Все статьи
Статья
21 июля 2026 г.4 мин

GLM 4.5 Air: лёгкая рабочая лошадка для массового инференса

Не каждая задача заслуживает флагман. GLM 4.5 Air — про дешёвый и быстрый инференс на объёме: классификация, роутинг, короткие ответы.

Ольга Мезенцева


GLM 4.5 Air: лёгкая рабочая лошадка для массового инференса

GLM 4.5 Air (glm-4.5-air) — самая экономичная модель линейки Z.AI. Её задача — не поражать глубиной, а дёшево и быстро закрывать поток однотипных запросов.

Где она на своём месте

  • Классификация. Разметить тикеты по категориям, определить тональность, отсортировать входящие. Air справляется, а стоит копейки.
  • Роутинг. Использовать как «привратника»: быстро понять, сложный вопрос или простой, и решить, отдавать ли его дальше во флагман.
  • Короткие ответы. FAQ-бот, автоответы, извлечение полей из текста.

Почему это выгодно

Типичная ошибка — гонять весь трафик через старшую модель «чтобы наверняка». На демо это работает, на проде счёт удваивается на пустом месте. 80% запросов в реальном продукте — простые, и им хватает Air.

from openai import OpenAI
client = OpenAI(base_url="https://api.yenisei.ru/v1", api_key="YENISEI_KEY")
resp = client.chat.completions.create(
model="glm-4.5-air",
messages=[
{"role": "system", "content": "Верни только категорию: billing, tech, sales."},
{"role": "user", "content": "У меня не проходит оплата картой."},
],
)
print(resp.choices[0].message.content) # billing

Честно о слабых местах

Air — не про сложные рассуждения. Многоходовую логику, тонкий рефакторинг, разбор большого документа с выводами ей не поручайте — начнёт срезать углы. Для этого есть GLM 4.6 и GLM 5.2.

Правильный паттерн — каскад: Air фильтрует и обрабатывает простое, сложное уходит выше. Так вы платите за интеллект только там, где он реально нужен.