Как выбрать модель под задачу: практический чек-лист
Десятки моделей в каталоге, а выбрать надо одну. Чек-лист по контексту, скорости, цене и типу задачи, чтобы не гадать и не переплачивать.
Команда Yenisei
Как выбрать модель под задачу: практический чек-лист
В каталоге десятки моделей, и «взять флагман на всё» — плохая стратегия: переплата и лишняя задержка. Выбор сводится к четырём вопросам. Пройдите их по порядку — и кандидатов останется один-два.
1. Какой тип задачи
Это отсекает большинство вариантов сразу:
- Классификация, извлечение полей, короткие ответы → Flash/Mini модели. Дёшево, быстро, качества достаточно.
- Сложная логика, математика, планирование, отладка → reasoning-модели (
deepseek-r1) или сильный Pro. - Код → специализированные (
qwen-coder,kimi-k2.7-code,deepseek). - Тексты и контент → Pro для важного, Flash для массового.
- Картинки, аудио → мультимодальные (
gemini,qwen-vl,voxtral). - Поиск по базе знаний → эмбеддинги (
bge-m3) плюс любая chat-модель на генерацию.
2. Сколько нужно контекста
Прикиньте максимальный вход: история диалога, документы, код.
- До ~8K — подойдёт почти любая модель.
- Десятки тысяч токенов (длинные диалоги, RAG) — берите модель с контекстом от 128K.
- Целые модули кода или большие документы разом — Kimi и другие long-context модели.
Не гонитесь за максимумом «про запас»: большой контекст — это ещё и большой счёт за входные токены.
3. Скорость важнее ума или наоборот
- Интерактив (чат, автодополнение, голос) — задержка критична. Flash + стриминг.
- Фоновая обработка (ночной разбор документов, отчёты) — можно ставить медленный флагман, пользователь не ждёт.
Правило: если человек смотрит на курсор и ждёт — скорость. Если результат кладётся в очередь — качество.
4. Сколько это будет стоить
Прикиньте объём: запросов в день × токенов на запрос. На массовом потоке разница Flash/Pro в 5–20x превращается в тысячи рублей. 1 кредит = 1 ₽ — считайте прямо в рублях. Для редких вызовов (пара сотен в день) на цену можно почти не смотреть, для тысяч — она решает.
Проверьте русский
Отдельный пункт для русскоязычного продукта: не все модели одинаково пишут на русском. DeepSeek, Qwen, Gemini — чисто, без кальки. Прогоните пару типовых запросов на своём домене перед выбором.
Не выбирайте вслепую — тестируйте
Чек-лист сузит выбор до двух-трёх кандидатов. Дальше — не спорьте в чате, а прогоните оба на 20–30 реальных примерах вашей задачи с эталонными ответами:
for model in ["qwen-flash", "deepseek-flash"]: for case in test_set: r = client.chat.completions.create( model=model, messages=case["messages"], temperature=0) score(model, case, r) # сравнить с эталоном, залогировать usageСмотрите одновременно на качество и на usage. Часто дешёвая модель проигрывает флагману на 2–3% точности при цене в 10 раз меньше — и для вашей задачи это выгодный размен.
Короткая шпаргалка
- Массовый инференс → Flash.
- Сложное и важное → Pro / reasoning.
- Код → coder-модели.
- Длинный вход → long-context.
- Мультимедиа → мультимодальные.
- Поиск по данным → эмбеддинги.
Начните с самой дешёвой модели, которая проходит по качеству на тесте, и поднимайтесь только там, где она реально не тянет. Это дешевле, чем начинать с флагмана и потом искать, где урезать.