GLM 4.5 Air: лёгкая рабочая лошадка для массового инференса
Не каждая задача заслуживает флагман. GLM 4.5 Air — про дешёвый и быстрый инференс на объёме: классификация, роутинг, короткие ответы.
Ольга Мезенцева
GLM 4.5 Air: лёгкая рабочая лошадка для массового инференса
GLM 4.5 Air (glm-4.5-air) — самая экономичная модель линейки Z.AI. Её задача — не поражать глубиной, а дёшево и быстро закрывать поток однотипных запросов.
Где она на своём месте
- Классификация. Разметить тикеты по категориям, определить тональность, отсортировать входящие. Air справляется, а стоит копейки.
- Роутинг. Использовать как «привратника»: быстро понять, сложный вопрос или простой, и решить, отдавать ли его дальше во флагман.
- Короткие ответы. FAQ-бот, автоответы, извлечение полей из текста.
Почему это выгодно
Типичная ошибка — гонять весь трафик через старшую модель «чтобы наверняка». На демо это работает, на проде счёт удваивается на пустом месте. 80% запросов в реальном продукте — простые, и им хватает Air.
from openai import OpenAIclient = OpenAI(base_url="https://api.yenisei.ru/v1", api_key="YENISEI_KEY")resp = client.chat.completions.create( model="glm-4.5-air", messages=[ {"role": "system", "content": "Верни только категорию: billing, tech, sales."}, {"role": "user", "content": "У меня не проходит оплата картой."}, ],)print(resp.choices[0].message.content) # billingЧестно о слабых местах
Air — не про сложные рассуждения. Многоходовую логику, тонкий рефакторинг, разбор большого документа с выводами ей не поручайте — начнёт срезать углы. Для этого есть GLM 4.6 и GLM 5.2.
Правильный паттерн — каскад: Air фильтрует и обрабатывает простое, сложное уходит выше. Так вы платите за интеллект только там, где он реально нужен.