Все модели

xAI

Grok Voice TTS 1.0

Речь с разметкой пауз и ударений прямо в тексте

Отвечает голосом
Текст
Голосов: 5
Тип
Синтез речи
Русский язык
высокий
Голосов
5
Цена
1 200 ₽ / 1M символов
Дата выхода
Май 2026
audio/speech
import OpenAI from "openai"
const client = new OpenAI({
baseURL: "https://api.yenisei.ru/v1",
apiKey: process.env.YENISEI_API_KEY,
})
const speech = await client.audio.speech.create({
model: "grok-voice",
input: "Здравствуйте! Это пример синтеза речи.",
voice: VOICE_ID, // идентификатор из списка голосов модели
response_format: "mp3",
})
const buffer = Buffer.from(await speech.arrayBuffer())
await writeFile("speech.mp3", buffer)

О модели

Grok Voice TTS 1.0 читает текст пятью голосами — Eve, Ara, Rex, Sal и Leo — и сама определяет, на каком языке он написан. Её особенность: разметку можно ставить прямо в тексте — пауза, ударение, высота, темп, — и модель их отработает, отдельного формата разметки не требуется. По словам издателя, говорит более чем на 20 языках и принимает до 15 000 символов за запрос.

Сильные стороны

  • Пять голосов: Eve, Ara, Rex, Sal, Leo
  • Пауза, ударение, высота и темп — тегами в тексте
  • Сама определяет язык текста
  • По словам издателя — более 20 языков, до 15 000 символов за запрос

Где применить

  • Озвучка с точной расстановкой пауз
  • Многоязычные записи без ручного переключения
  • Длинные тексты одним запросом