GPT-5-mini: 1200 reasoning-токенов за 13.9 секунды, TTFT 249 мс
Лог API-ответа от модели openai/gpt-5-mini показывает конкретные метрики инференса: 1200 completion_tokens (все reasoning), 3188 prompt_tokens (из них 3072 кешированы), latency 13.9 секунд и TTFT 249 мс. Ответ обрезан по лимиту длины.
Что
Опубликован полный JSON-ответ API от модели openai/gpt-5-mini (chat completion). Ответ завершился по finish_reason: length, что означает обрезку по лимиту токенов.
Как
Модель сгенерировала 1200 токенов reasoning (цепочки рассуждений) и 0 токенов обычного контента. Это указывает на то, что gpt-5-mini, вероятно, использует архитектуру с явным разделением reasoning и ответа, где reasoning-токены учитываются в completion_tokens.
Цифры
- completion_tokens: 1200 (все reasoning_tokens)
- prompt_tokens: 3188 (из них 3072 кешированы — 96.4%)
- total_tokens: 4388
- Latency (total_duration_ms): 13 905 мс (~13.9 секунд)
- TTFT (user_visible_ttft_ms): 249 мс
- Engine TTFT: 38 мс (внутренняя задержка до генерации первого токена)
- Service TTFT: 413 мс (полная задержка до получения первого токена клиентом)
Что перенять
Высокий процент кешированных промпт-токенов (96.4%) — это паттерн, который стоит применять: повторяющиеся системные промпты или длинные контексты эффективно кешируются, снижая стоимость и latency. Разница между engine_ttft_ms (38 мс) и user_visible_ttft_ms (249 мс) показывает, что ~211 мс уходит на сетевую инфраструктуру и оркестрацию — это нижняя граница для оптимизации клиентских интеграций.
Кеширование 96% промпт-токенов + reasoning-токены в completion_tokens: gpt-5-mini явно разделяет reasoning и генерацию, а высокий cache-hit снижает latency и стоимость при повторных запросах с похожим контекстом.