Блог Yenisei
Новости платформы и статьи о работе с языковыми моделями: API, RAG, эмбеддинги, рассуждения и практика внедрения.
Anthropic выпустила Fable 5.1 первого сентября, у нас она доступна сразу: миллион токенов контекста, картинки на входе, вызов инструментов. Работает без VPN, оплата в рублях по факту использования.
Вся линейка OpenAI в одном каталоге: GPT-5.6 Sol, Terra и Luna, GPT-5.5 Pro, o3 и o4-mini, открытые GPT-OSS и три модели эмбеддингов. Доступ без VPN, счета в рублях, один OpenAI-совместимый ключ.
Пополнение каталога Yenisei: флагманы сентября, недорогие рабочие лошадки от 1,68 ₽ за 1M токенов и три кодовые модели. Все доступны без VPN, оплата в рублях по факту использования.
Добавили Ox Alpha — reasoning-модель без имени автора для кода и агентных сценариев: контекст 1M, вход с картинками и видео, обязательные размышления. Кто её сделал — не знает никто.
BGE-M3, Qwen3 Embedding, text-embedding-3, Gemini Embedding — чем отличаются, как влияет размерность вектора и почему для русского важна многоязычность.
Десятки моделей в каталоге, а выбрать надо одну. Чек-лист по контексту, скорости, цене и типу задачи, чтобы не гадать и не переплачивать.
Xiaomi выкатила сильную открытую линейку: reasoning, инструменты и контекст 1M у Pro-версии. Добавили обе и рассказываем, кому они интересны.
Модель с веб-поиском — не волшебство: качество зависит от того, как вы формулируете запрос и проверяете источники. Разбираем приёмы.
Где утекают деньги на LLM и как их вернуть. Подсчёт токенов, выбор модели под задачу, кэширование и обрезка контекста. 1 кредит = 1 ₽.
Три модели Sonar, ориентированные на ответы со свежими данными из веба. Добавили и объясняем, чем они отличаются от обычных чат-моделей.
Рассуждающие модели решают то, на чём обычные ломаются, но стоят дороже и думают дольше. Как выбрать уровень усилий и не платить за лишние размышления.
Корпоративному ассистенту мало «правильного» ответа — нужна ссылка на источник. Собираем RAG на Command A так, чтобы каждое утверждение было проверяемо.
Флагман Cohere с корпоративным уклоном и компактная R7B. Добавили обе и объясняем, почему Command A — это в первую очередь про RAG.
Reasoning-модель, которая умеет вызывать функции — удобная основа для агента. Собираем минимальный цикл tool-calling на base_url Yenisei.
Транскрипция звонков, голосовые боты, разбор совещаний. Voxtral и Gemini на аудио: как подать файл, обработать длинные записи и не потерять смысл.
Новее не всегда значит лучше под конкретную задачу. Разбираем, где Llama 3.3 70B остаётся разумным выбором и когда стоит перейти на Llama 4.
Открытая линейка Meta пополнилась мультимодальными Scout и Maverick. Добавили обе плюс проверенную Llama 3.3 70B. Разбираем, кому какая.
Reasoning, зрение, инструменты и контекст 500K. Добавили свежий флагман xAI и рассказываем, где он реально сильнее привычных моделей.
Mistral закрыла аудио отдельной моделью. Voxtral Small — про транскрипцию и понимание речи. Показываем, как встроить её в обработку звонков и заметок.
Большое окно — не бесплатное. Показываем, как строить запросы к Nova Premier на длинных документах, чтобы платить за контекст осознанно.
Мультимодальные модели читают сканы, таблицы и скриншоты. Как подать картинку, вытащить структуру и не переплатить за токены изображения.
Добавили четыре модели Mistral разом. Large c контекстом 262K и vision, Medium как золотая середина, Small и компактная Nemo. Разбираем, что под какую задачу.
Добавили сразу четыре модели Amazon: от дешёвой текстовой Micro до мультимодального флагмана Premier с миллионным контекстом. Разбираем, кому какая.
K2.7 Code — отдельная сборка Kimi под разработку. Разбираем, где специализированная кодовая модель обыгрывает универсальную и как встроить её в рабочий цикл.
response_format и JSON Schema превращают модель в надёжный парсер. Как получать структурированные данные без регулярок и без сюрпризов.
Две универсальные модели Moonshot. Одна разворачивает цепочку мыслей, вторая отвечает прямо. Разбираем, когда reasoning окупается, а когда только жжёт токены.
Три топовых семейства проприетарных моделей в одном каталоге. Без религиозных войн — практический разбор, у кого какие сильные стороны и как не переплатить.
Открытая линейка Google в двух размерах, обе с поддержкой изображений. Зачем открытая модель, когда рядом закрытые флагманы, и как выбрать между 12B и 27B.
Новое поколение Moonshot приехало в каталог. Kimi K3 — это контекст 1M, reasoning, работа с картинками и tools в одной модели. Смотрим, чем она берёт.
LLM переводит лучше классических движков, если правильно поставить задачу. Глоссарии, тон, сохранение разметки и выбор модели под русский.
Добавили две модели Google с окном на миллион токенов. Обе понимают текст, изображения, аудио и видео — редкое сочетание, из-за которого их берут даже там, где есть свой флагман.
Не каждая задача заслуживает флагман. GLM 4.5 Air — про дешёвый и быстрый инференс на объёме: классификация, роутинг, короткие ответы.
На фоне GPT-5 и reasoning-моделей GPT-4o легко списать. Зря. Разбираем, где быстрая мультимодальная модель со 128K контекста до сих пор оптимальна.
Две модели Z.AI под агентов и reasoning. Одна думает основательнее, вторая отвечает почти мгновенно. Разбираем, как не переплачивать за латентность.
Как получать от модели тексты, которые не стыдно опубликовать. Управление тоном, структурой и длиной без ручной переписки.
Отдельная ветка OpenAI, где модель тратит больше времени на размышление ради точности. Разбираем, чем reasoning-модели отличаются от обычного GPT и когда за это стоит платить.
Старшая модель Z.AI приехала к нам целиком: контекст 1M, честный reasoning и tools. Рассказываем, где она реально сильнее китайских конкурентов, а где переплата.
Верхняя модель линейки GPT — контекст вырос почти до миллиона токенов. Когда это реально меняет дело, а когда вы платите за окно, которое не используете.
Две универсальные reasoning-модели на 27B от Alibaba. Разбираем, чем они отличаются друг от друга и когда 27B — правильный размер.
Как собрать бота первой линии, который отвечает за доли секунды и не разоряет. Flash/Mini модели, стриминг, эскалация на человека.
Редкое сочетание: низкая задержка, контекст 1M и работа с картинками одновременно. Разбираем, под какие продукты это идеально ложится.
Добавили три модели OpenAI одним заходом — от старшей Pro до крохотной Nano. У всех reasoning, vision и контекст 400K. Разбираем, какую под какую нагрузку.
Старшая Qwen с окном на 262K токенов, function calling и уверенным русским. Золотая середина между обычным чатом и миллионным контекстом.
Ещё одна модель Anthropic с контекстом 1M, ориентированная на инженерные сценарии — генерацию кода и длинные агентные цепочки. Где она обходит даже Opus.
Специализированная кодовая Qwen на 30B. Разбираем, чем узкая модель под код бьёт универсальную и где её ставить в пайплайн разработки.
Qwen Coder, Kimi K2.7 Code, DeepSeek — чем отличаются на реальном коде. Как встроить в редактор и не разориться на автодополнении.
Старшая Qwen от Alibaba умеет держать в голове миллион токенов, читает картинки и свободно говорит по-русски. Смотрим, что это даёт на практике.
Младшая модель Anthropic — когда нужна не глубина, а скорость и цена, но с сохранением аккуратности Claude. Контекст 200K и, что неожиданно для лёгкой модели, reasoning.
Pro, Flash, V3.1 или R1 — четыре модели, четыре разных повода. Короткая карта решений с примерами, чтобы не гадать.
Флагман Anthropic и его сбалансированный младший брат — оба с контекстом на миллион токенов. Рассказываем, чем они отличаются на практике и когда переплата за Opus окупается.
Модель сама решает, когда дёрнуть вашу функцию. Разбираю схему tools, цикл выполнения и типичные грабли с параллельными вызовами.
V3.1 — крепкий середняк на каждый день: 131K контекста, function calling и уверенный русский. Рассказываем, почему это хороший дефолт.
R1 показывает не только ответ, но и то, как она к нему пришла. Разбираем, зачем вам видеть ход мысли модели и где это меняет дело.
Векторный поиск на bge-m3, POST /v1/embeddings и сборка контекста. Показываю рабочий пайплайн и места, где RAG обычно ломается.
Младшая V4 отвечает почти мгновенно и стоит втрое дешевле флагмана. Показываем сценарии, где Flash выигрывает у Pro не только по цене.
Добавили флагман DeepSeek — модель, которая одинаково уверенно рассуждает и пишет код. Разбираем, за что она берёт деньги и когда это оправдано.