Блог Yenisei

Новости платформы и статьи о работе с языковыми моделями: API, RAG, эмбеддинги, рассуждения и практика внедрения.

Новости
3 сентября 2026 г.
Claude Fable 5.1 уже в каталоге Yenisei — без VPN и с оплатой в рублях

Anthropic выпустила Fable 5.1 первого сентября, у нас она доступна сразу: миллион токенов контекста, картинки на входе, вызов инструментов. Работает без VPN, оплата в рублях по факту использования.

4 минЧитать
Статья
3 сентября 2026 г.
Модели OpenAI в Yenisei: GPT-5.6, o3 и эмбеддинги без VPN, оплата в рублях

Вся линейка OpenAI в одном каталоге: GPT-5.6 Sol, Terra и Luna, GPT-5.5 Pro, o3 и o4-mini, открытые GPT-OSS и три модели эмбеддингов. Доступ без VPN, счета в рублях, один OpenAI-совместимый ключ.

6 минЧитать
Новости
3 сентября 2026 г.
16 новых моделей в каталоге: Fable 5.1, Gemini 3.8, Qwen3.8, GLM 5.3 и другие

Пополнение каталога Yenisei: флагманы сентября, недорогие рабочие лошадки от 1,68 ₽ за 1M токенов и три кодовые модели. Все доступны без VPN, оплата в рублях по факту использования.

7 минЧитать
Новости
25 августа 2026 г.
Ox Alpha: анонимная новинка в каталоге Yenisei

Добавили Ox Alpha — reasoning-модель без имени автора для кода и агентных сценариев: контекст 1M, вход с картинками и видео, обязательные размышления. Кто её сделал — не знает никто.

4 минЧитать
Статья
17 августа 2026 г.
Как выбрать модель эмбеддингов для RAG и семантического поиска

BGE-M3, Qwen3 Embedding, text-embedding-3, Gemini Embedding — чем отличаются, как влияет размерность вектора и почему для русского важна многоязычность.

8 минЧитать
Статья
16 августа 2026 г.
Как выбрать модель под задачу: практический чек-лист

Десятки моделей в каталоге, а выбрать надо одну. Чек-лист по контексту, скорости, цене и типу задачи, чтобы не гадать и не переплачивать.

6 минЧитать
Новости
15 августа 2026 г.
Xiaomi MiMo v2.5 и v2.5 Pro в каталоге Yenisei

Xiaomi выкатила сильную открытую линейку: reasoning, инструменты и контекст 1M у Pro-версии. Добавили обе и рассказываем, кому они интересны.

4 минЧитать
Статья
14 августа 2026 г.
Свежие ответы со ссылками: как выжимать максимум из Sonar

Модель с веб-поиском — не волшебство: качество зависит от того, как вы формулируете запрос и проверяете источники. Разбираем приёмы.

6 минЧитать
Статья
14 августа 2026 г.
Оптимизация стоимости: как считать токены и экономить

Где утекают деньги на LLM и как их вернуть. Подсчёт токенов, выбор модели под задачу, кэширование и обрезка контекста. 1 кредит = 1 ₽.

7 минЧитать
Новости
12 августа 2026 г.
Perplexity Sonar: модели с опорой на веб-поиск теперь в Yenisei

Три модели Sonar, ориентированные на ответы со свежими данными из веба. Добавили и объясняем, чем они отличаются от обычных чат-моделей.

5 минЧитать
Статья
11 августа 2026 г.
Reasoning-модели: когда включать reasoning_effort

Рассуждающие модели решают то, на чём обычные ломаются, но стоят дороже и думают дольше. Как выбрать уровень усилий и не платить за лишние размышления.

7 минЧитать
Статья
10 августа 2026 г.
RAG на Command A: ответы с цитатами, которым можно верить

Корпоративному ассистенту мало «правильного» ответа — нужна ссылка на источник. Собираем RAG на Command A так, чтобы каждое утверждение было проверяемо.

8 минЧитать
Новости
8 августа 2026 г.
Cohere Command A и Command R7B в каталоге

Флагман Cohere с корпоративным уклоном и компактная R7B. Добавили обе и объясняем, почему Command A — это в первую очередь про RAG.

5 минЧитать
Статья
7 августа 2026 г.
Grok 4.6 как ядро агента: рассуждения плюс инструменты

Reasoning-модель, которая умеет вызывать функции — удобная основа для агента. Собираем минимальный цикл tool-calling на base_url Yenisei.

7 минЧитать
Статья
7 августа 2026 г.
Голос и аудио: сценарии с речевыми моделями

Транскрипция звонков, голосовые боты, разбор совещаний. Voxtral и Gemini на аудио: как подать файл, обработать длинные записи и не потерять смысл.

6 минЧитать
Статья
6 августа 2026 г.
Llama 3.3 70B: почему проверенная открытая модель всё ещё в деле

Новее не всегда значит лучше под конкретную задачу. Разбираем, где Llama 3.3 70B остаётся разумным выбором и когда стоит перейти на Llama 4.

5 минЧитать
Новости
5 августа 2026 г.
Llama 4 в каталоге: мультимодальные Scout и Maverick от Meta

Открытая линейка Meta пополнилась мультимодальными Scout и Maverick. Добавили обе плюс проверенную Llama 3.3 70B. Разбираем, кому какая.

6 минЧитать
Новости
5 августа 2026 г.
xAI Grok 4.6 доступен в Yenisei

Reasoning, зрение, инструменты и контекст 500K. Добавили свежий флагман xAI и рассказываем, где он реально сильнее привычных моделей.

5 минЧитать
Статья
3 августа 2026 г.
Voxtral Small: работа с речью и аудио от Mistral

Mistral закрыла аудио отдельной моделью. Voxtral Small — про транскрипцию и понимание речи. Показываем, как встроить её в обработку звонков и заметок.

5 минЧитать
Статья
3 августа 2026 г.
Nova Premier и миллион токенов: как не утонуть в контексте

Большое окно — не бесплатное. Показываем, как строить запросы к Nova Premier на длинных документах, чтобы платить за контекст осознанно.

7 минЧитать
Статья
3 августа 2026 г.
Работа с изображениями: vision для документов и скриншотов

Мультимодальные модели читают сканы, таблицы и скриншоты. Как подать картинку, вытащить структуру и не переплатить за токены изображения.

7 минЧитать
Новости
1 августа 2026 г.
Линейка Mistral в каталоге: Large, Medium 3.1, Small и Nemo

Добавили четыре модели Mistral разом. Large c контекстом 262K и vision, Medium как золотая середина, Small и компактная Nemo. Разбираем, что под какую задачу.

6 минЧитать
Новости
1 августа 2026 г.
Линейка Amazon Nova в каталоге Yenisei

Добавили сразу четыре модели Amazon: от дешёвой текстовой Micro до мультимодального флагмана Premier с миллионным контекстом. Разбираем, кому какая.

5 минЧитать
Статья
30 июля 2026 г.
Kimi K2.7 Code: модель Moonshot, ориентированная на код

K2.7 Code — отдельная сборка Kimi под разработку. Разбираем, где специализированная кодовая модель обыгрывает универсальную и как встроить её в рабочий цикл.

6 минЧитать
Статья
29 июля 2026 г.
Классификация и извлечение полей: JSON-режим

response_format и JSON Schema превращают модель в надёжный парсер. Как получать структурированные данные без регулярок и без сюрпризов.

7 минЧитать
Статья
27 июля 2026 г.
Kimi K2 Thinking или K2: показывать рассуждения или нет

Две универсальные модели Moonshot. Одна разворачивает цепочку мыслей, вторая отвечает прямо. Разбираем, когда reasoning окупается, а когда только жжёт токены.

5 минЧитать
Статья
26 июля 2026 г.
Claude, GPT или Gemini: как выбрать под конкретную задачу

Три топовых семейства проприетарных моделей в одном каталоге. Без религиозных войн — практический разбор, у кого какие сильные стороны и как не переплатить.

8 минЧитать
Статья
24 июля 2026 г.
Gemma 3 (12B и 27B): открытые модели Google с vision

Открытая линейка Google в двух размерах, обе с поддержкой изображений. Зачем открытая модель, когда рядом закрытые флагманы, и как выбрать между 12B и 27B.

5 минЧитать
Новости
24 июля 2026 г.
Kimi K3 от Moonshot: миллион токенов, зрение и инструменты

Новое поколение Moonshot приехало в каталог. Kimi K3 — это контекст 1M, reasoning, работа с картинками и tools в одной модели. Смотрим, чем она берёт.

6 минЧитать
Статья
23 июля 2026 г.
Перевод и локализация: какие модели сильны в русском

LLM переводит лучше классических движков, если правильно поставить задачу. Глоссарии, тон, сохранение разметки и выбор модели под русский.

6 минЧитать
Новости
22 июля 2026 г.
Gemini 2.5 Pro и 3.7 Flash: мультимодальность Google в каталоге

Добавили две модели Google с окном на миллион токенов. Обе понимают текст, изображения, аудио и видео — редкое сочетание, из-за которого их берут даже там, где есть свой флагман.

6 минЧитать
Статья
21 июля 2026 г.
GLM 4.5 Air: лёгкая рабочая лошадка для массового инференса

Не каждая задача заслуживает флагман. GLM 4.5 Air — про дешёвый и быстрый инференс на объёме: классификация, роутинг, короткие ответы.

4 минЧитать
Статья
19 июля 2026 г.
GPT-4o всё ещё в деле: когда мультимодальная классика выигрывает

На фоне GPT-5 и reasoning-моделей GPT-4o легко списать. Зря. Разбираем, где быстрая мультимодальная модель со 128K контекста до сих пор оптимальна.

5 минЧитать
Статья
17 июля 2026 г.
GLM 4.6 и GLM 4.7 Flash: когда нужна голова, а когда скорость

Две модели Z.AI под агентов и reasoning. Одна думает основательнее, вторая отвечает почти мгновенно. Разбираем, как не переплачивать за латентность.

5 минЧитать
Статья
17 июля 2026 г.
Генерация контента: тексты, описания, письма

Как получать от модели тексты, которые не стыдно опубликовать. Управление тоном, структурой и длиной без ручной переписки.

6 минЧитать
Статья
16 июля 2026 г.
o3 и o4-mini: reasoning-модели OpenAI в каталоге

Отдельная ветка OpenAI, где модель тратит больше времени на размышление ради точности. Разбираем, чем reasoning-модели отличаются от обычного GPT и когда за это стоит платить.

7 минЧитать
Новости
14 июля 2026 г.
GLM 5.2 в каталоге: миллион токенов и рассуждения от Z.AI

Старшая модель Z.AI приехала к нам целиком: контекст 1M, честный reasoning и tools. Рассказываем, где она реально сильнее китайских конкурентов, а где переплата.

6 минЧитать
Новости
13 июля 2026 г.
GPT-5.5 Pro: старшая модель OpenAI с контекстом ~1M

Верхняя модель линейки GPT — контекст вырос почти до миллиона токенов. Когда это реально меняет дело, а когда вы платите за окно, которое не используете.

4 минЧитать
Новости
12 июля 2026 г.
Reasoning-модели Qwen 27B: Qwen3.8 и Qwen3.5 в каталоге

Две универсальные reasoning-модели на 27B от Alibaba. Разбираем, чем они отличаются друг от друга и когда 27B — правильный размер.

5 минЧитать
Статья
11 июля 2026 г.
Боты поддержки: дёшево и быстро на Flash-моделях

Как собрать бота первой линии, который отвечает за доли секунды и не разоряет. Flash/Mini модели, стриминг, эскалация на человека.

6 минЧитать
Статья
10 июля 2026 г.
Qwen3.7 Flash: быстрая мультимодальная модель с миллионным окном

Редкое сочетание: низкая задержка, контекст 1M и работа с картинками одновременно. Разбираем, под какие продукты это идеально ложится.

6 минЧитать
Новости
10 июля 2026 г.
Линейка GPT-5 в каталоге: Pro, Mini и Nano

Добавили три модели OpenAI одним заходом — от старшей Pro до крохотной Nano. У всех reasoning, vision и контекст 400K. Разбираем, какую под какую нагрузку.

6 минЧитать
Новости
8 июля 2026 г.
Qwen3 Max в каталоге: 262K контекста и инструменты

Старшая Qwen с окном на 262K токенов, function calling и уверенным русским. Золотая середина между обычным чатом и миллионным контекстом.

4 минЧитать
Новости
8 июля 2026 г.
Claude Fable 5 в каталоге: модель под код и агентов

Ещё одна модель Anthropic с контекстом 1M, ориентированная на инженерные сценарии — генерацию кода и длинные агентные цепочки. Где она обходит даже Opus.

5 минЧитать
Статья
6 июля 2026 г.
Qwen3 Coder 30B: модель, ориентированная на код

Специализированная кодовая Qwen на 30B. Разбираем, чем узкая модель под код бьёт универсальную и где её ставить в пайплайн разработки.

6 минЧитать
Статья
5 июля 2026 г.
Ассистент для кода: выбор модели и интеграция

Qwen Coder, Kimi K2.7 Code, DeepSeek — чем отличаются на реальном коде. Как встроить в редактор и не разориться на автодополнении.

7 минЧитать
Новости
4 июля 2026 г.
Qwen3.7 Plus в каталоге: миллион токенов контекста и vision

Старшая Qwen от Alibaba умеет держать в голове миллион токенов, читает картинки и свободно говорит по-русски. Смотрим, что это даёт на практике.

6 минЧитать
Новости
4 июля 2026 г.
Claude Haiku 4.5: быстрый Claude для потока запросов

Младшая модель Anthropic — когда нужна не глубина, а скорость и цена, но с сохранением аккуратности Claude. Контекст 200K и, что неожиданно для лёгкой модели, reasoning.

4 минЧитать
Статья
2 июля 2026 г.
Как выбрать модель DeepSeek под задачу

Pro, Flash, V3.1 или R1 — четыре модели, четыре разных повода. Короткая карта решений с примерами, чтобы не гадать.

7 минЧитать
Новости
1 июля 2026 г.
Claude Opus 5 и Sonnet 5 добавлены в каталог

Флагман Anthropic и его сбалансированный младший брат — оба с контекстом на миллион токенов. Рассказываем, чем они отличаются на практике и когда переплата за Opus окупается.

6 минЧитать
Статья
30 июня 2026 г.
Агенты и вызов инструментов: как строить function-calling

Модель сама решает, когда дёрнуть вашу функцию. Разбираю схему tools, цикл выполнения и типичные грабли с параллельными вызовами.

8 минЧитать
Новости
29 июня 2026 г.
DeepSeek V3.1 в каталоге: универсальный чат с русским и инструментами

V3.1 — крепкий середняк на каждый день: 131K контекста, function calling и уверенный русский. Рассказываем, почему это хороший дефолт.

5 минЧитать
Новости
26 июня 2026 г.
DeepSeek R1: reasoning с открытой цепочкой рассуждений

R1 показывает не только ответ, но и то, как она к нему пришла. Разбираем, зачем вам видеть ход мысли модели и где это меняет дело.

5 минЧитать
Статья
25 июня 2026 г.
RAG на эмбеддингах: как связать модель с базой знаний

Векторный поиск на bge-m3, POST /v1/embeddings и сборка контекста. Показываю рабочий пайплайн и места, где RAG обычно ломается.

9 минЧитать
Статья
23 июня 2026 г.
DeepSeek V4 Flash: когда нужен быстрый и дешёвый инференс

Младшая V4 отвечает почти мгновенно и стоит втрое дешевле флагмана. Показываем сценарии, где Flash выигрывает у Pro не только по цене.

6 минЧитать
Новости
20 июня 2026 г.
DeepSeek V4 Pro теперь в каталоге Yenisei

Добавили флагман DeepSeek — модель, которая одинаково уверенно рассуждает и пишет код. Разбираем, за что она берёт деньги и когда это оправдано.

5 минЧитать