Все статьи
Статья
16 августа 2026 г.6 мин

Как выбрать модель под задачу: практический чек-лист

Десятки моделей в каталоге, а выбрать надо одну. Чек-лист по контексту, скорости, цене и типу задачи, чтобы не гадать и не переплачивать.

Команда Yenisei


Как выбрать модель под задачу: практический чек-лист

В каталоге десятки моделей, и «взять флагман на всё» — плохая стратегия: переплата и лишняя задержка. Выбор сводится к четырём вопросам. Пройдите их по порядку — и кандидатов останется один-два.

1. Какой тип задачи

Это отсекает большинство вариантов сразу:

  • Классификация, извлечение полей, короткие ответы → Flash/Mini модели. Дёшево, быстро, качества достаточно.
  • Сложная логика, математика, планирование, отладка → reasoning-модели (deepseek-r1) или сильный Pro.
  • Код → специализированные (qwen-coder, kimi-k2.7-code, deepseek).
  • Тексты и контент → Pro для важного, Flash для массового.
  • Картинки, аудио → мультимодальные (gemini, qwen-vl, voxtral).
  • Поиск по базе знаний → эмбеддинги (bge-m3) плюс любая chat-модель на генерацию.

2. Сколько нужно контекста

Прикиньте максимальный вход: история диалога, документы, код.

  • До ~8K — подойдёт почти любая модель.
  • Десятки тысяч токенов (длинные диалоги, RAG) — берите модель с контекстом от 128K.
  • Целые модули кода или большие документы разом — Kimi и другие long-context модели.

Не гонитесь за максимумом «про запас»: большой контекст — это ещё и большой счёт за входные токены.

3. Скорость важнее ума или наоборот

  • Интерактив (чат, автодополнение, голос) — задержка критична. Flash + стриминг.
  • Фоновая обработка (ночной разбор документов, отчёты) — можно ставить медленный флагман, пользователь не ждёт.

Правило: если человек смотрит на курсор и ждёт — скорость. Если результат кладётся в очередь — качество.

4. Сколько это будет стоить

Прикиньте объём: запросов в день × токенов на запрос. На массовом потоке разница Flash/Pro в 5–20x превращается в тысячи рублей. 1 кредит = 1 ₽ — считайте прямо в рублях. Для редких вызовов (пара сотен в день) на цену можно почти не смотреть, для тысяч — она решает.

Проверьте русский

Отдельный пункт для русскоязычного продукта: не все модели одинаково пишут на русском. DeepSeek, Qwen, Gemini — чисто, без кальки. Прогоните пару типовых запросов на своём домене перед выбором.

Не выбирайте вслепую — тестируйте

Чек-лист сузит выбор до двух-трёх кандидатов. Дальше — не спорьте в чате, а прогоните оба на 20–30 реальных примерах вашей задачи с эталонными ответами:

for model in ["qwen-flash", "deepseek-flash"]:
for case in test_set:
r = client.chat.completions.create(
model=model, messages=case["messages"], temperature=0)
score(model, case, r) # сравнить с эталоном, залогировать usage

Смотрите одновременно на качество и на usage. Часто дешёвая модель проигрывает флагману на 2–3% точности при цене в 10 раз меньше — и для вашей задачи это выгодный размен.

Короткая шпаргалка

  • Массовый инференс → Flash.
  • Сложное и важное → Pro / reasoning.
  • Код → coder-модели.
  • Длинный вход → long-context.
  • Мультимедиа → мультимодальные.
  • Поиск по данным → эмбеддинги.

Начните с самой дешёвой модели, которая проходит по качеству на тесте, и поднимайтесь только там, где она реально не тянет. Это дешевле, чем начинать с флагмана и потом искать, где урезать.