ИнференсВозможности
Потоковый ответ
С stream: true ответ приходит по частям, как в чате.
curl https://api.yenisei.ru/v1/chat/completions \
-H "Authorization: Bearer $YENISEI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "yenisei-100",
"messages": [{"role": "user", "content": "Расскажи про Енисей"}],
"stream": true
}'
# client — как на странице «Первый запрос»
stream = client.chat.completions.create(
model="yenisei-100",
messages=[{"role": "user", "content": "Расскажи про Енисей"}],
stream=True,
)
for chunk in stream:
part = chunk.choices[0].delta.content
if part:
print(part, end="", flush=True)
Ответ приходит событиями Server-Sent Events: строки data: {…} с кусочками
текста в choices[].delta.content, последняя строка — data: [DONE].
Пока поток идёт, соединение держится открытым. Если оно оборвалось на
середине, часть ответа уже списана: продолжать разговор придётся новым
запросом, добавив полученное в messages.