Voxtral Small: работа с речью и аудио от Mistral
Mistral закрыла аудио отдельной моделью. Voxtral Small — про транскрипцию и понимание речи. Показываем, как встроить её в обработку звонков и заметок.
Алексей Гринёв
Voxtral Small: работа с речью и аудио от Mistral
Voxtral Small (voxtral-small) — специализированная модель Mistral под аудио и речь. Пока большинство LLM работают только с текстом, здесь звук — вход первого класса, а не костыль поверх отдельного распознавателя.
Зачем отдельная аудио-модель
Классическая связка «STT-движок → текст → LLM» теряет много по дороге: интонацию, паузы, кто говорит, эмоцию. Voxtral понимает речь ближе к смыслу, а не просто переводит звук в буквы. Для разбора звонков и встреч это качественно другой результат.
Что на неё вешать
- Транскрипция звонков, встреч, голосовых заметок.
- Суммаризация записей: не дословная расшифровка, а «о чём договорились и какие задачи».
- Понимание команд в голосовых интерфейсах.
Как позвать
from openai import OpenAIclient = OpenAI(base_url="https://api.yenisei.ru/v1", api_key="YENISEI_KEY")resp = client.chat.completions.create( model="voxtral-small", messages=[{ "role": "user", "content": [ {"type": "text", "text": "Сделай саммари звонка: решения и задачи."}, {"type": "input_audio", "input_audio": {"data": "<base64>", "format": "mp3"}}, ], }],)print(resp.choices[0].message.content)Русская речь
Отдельно проверяли на русских звонках с фоновым шумом и перебивками — типичная реальность колл-центра, а не студийная запись. Voxtral держит русский заметно лучше, чем можно было ожидать от европейской модели: имена и термины иногда правит, но общий смысл и структуру диалога передаёт верно.
Практичный сценарий
Связка «Voxtral → текстовая модель» работает лучше всего: Voxtral превращает звонок в осмысленный текст, а дальше Mistral Medium или другая модель делает саммари, извлекает задачи, заводит тикеты. Каждая модель — на своём месте, и качество на выходе выше, чем у одного универсального решения.