🆕 Новые модели 1 мин чтения

GPT-5-mini: 1200 reasoning-токенов за 13.9 секунды, TTFT 249 мс

Лог API-ответа от модели openai/gpt-5-mini показывает конкретные метрики инференса: 1200 completion_tokens (все reasoning), 3188 prompt_tokens (из них 3072 кешированы), latency 13.9 секунд и TTFT 249 мс. Ответ обрезан по лимиту длины.

Что

Опубликован полный JSON-ответ API от модели openai/gpt-5-mini (chat completion). Ответ завершился по finish_reason: length, что означает обрезку по лимиту токенов.

Как

Модель сгенерировала 1200 токенов reasoning (цепочки рассуждений) и 0 токенов обычного контента. Это указывает на то, что gpt-5-mini, вероятно, использует архитектуру с явным разделением reasoning и ответа, где reasoning-токены учитываются в completion_tokens.

Цифры

  • completion_tokens: 1200 (все reasoning_tokens)
  • prompt_tokens: 3188 (из них 3072 кешированы — 96.4%)
  • total_tokens: 4388
  • Latency (total_duration_ms): 13 905 мс (~13.9 секунд)
  • TTFT (user_visible_ttft_ms): 249 мс
  • Engine TTFT: 38 мс (внутренняя задержка до генерации первого токена)
  • Service TTFT: 413 мс (полная задержка до получения первого токена клиентом)

Что перенять

Высокий процент кешированных промпт-токенов (96.4%) — это паттерн, который стоит применять: повторяющиеся системные промпты или длинные контексты эффективно кешируются, снижая стоимость и latency. Разница между engine_ttft_ms (38 мс) и user_visible_ttft_ms (249 мс) показывает, что ~211 мс уходит на сетевую инфраструктуру и оркестрацию — это нижняя граница для оптимизации клиентских интеграций.

Кеширование 96% промпт-токенов + reasoning-токены в completion_tokens: gpt-5-mini явно разделяет reasoning и генерацию, а высокий cache-hit снижает latency и стоимость при повторных запросах с похожим контекстом.