Все модели

Qwen

Qwen Audio 3.0 TTS Flash

Быстрый синтез речи, два голоса

Отвечает голосом
Текст
Голосов: 2
Тип
Синтез речи
Русский язык
высокий
Голосов
2
Цена
1 200 ₽ / 1M символов
Дата выхода
Июль 2026
audio/speech
import OpenAI from "openai"
const client = new OpenAI({
baseURL: "https://api.yenisei.ru/v1",
apiKey: process.env.YENISEI_API_KEY,
})
const speech = await client.audio.speech.create({
model: "qwen-tts-flash",
input: "Здравствуйте! Это пример синтеза речи.",
voice: VOICE_ID, // идентификатор из списка голосов модели
response_format: "mp3",
})
const buffer = Buffer.from(await speech.arrayBuffer())
await writeFile("speech.mp3", buffer)

О модели

Qwen Audio 3.0 TTS Flash превращает текст в речь: вы отдаёте текст, получаете звук. В отличие от голосовых собеседников она читает присланное, а не отвечает на него. Младшая в линейке и дешевле старшей — её берут на поток: уведомления, ответы помощника, короткие сообщения. Оплата у речевых моделей считается за символы, а не за токены.

Сильные стороны

  • Читает присланный текст, а не отвечает на него
  • Два голоса на выбор
  • Дешевле старшей модели линейки
  • Оплата за символы

Где применить

  • Озвучивание уведомлений
  • Голосовые ответы помощника
  • Короткие сообщения потоком