Сравнение LLM avr-latency v37

Меряет TTFT — время до первого настоящего токена ответа — на реальном системном промпте и tool-схеме бота, а не на «hello world». Reasoning-токены скрыты, как в проде, поэтому число сравнимо с тем, что слышит абонент. · ← живая панель · Статистика · Тесты

Прогон

запросов на провайдера: доп. символов в промпте: reasoning_effort (через запятую):
— разблокирует уровни размышления у gpt-5.x
Это стоит денег. Каждый запрос — реальный оплачиваемый вызов провайдера. Запросов = провайдеры × уровни effort × «запросов на провайдера». Внутри одного провайдера запросы идут цепочкой (как на живом звонке), провайдеры — параллельно.
«Доп. символов» раздувает системный промпт, чтобы заранее увидеть, кто выиграет, когда промпт вырастет: победитель на сегодняшнем промпте не обязан остаться победителем на вдвое большем.
«Без тулов» убирает tool-схему. Нужно потому, что OpenAI не принимает function tools вместе с reasoning_effort ≠ none у gpt-5.x — с тулами Luna умеет ровно один уровень, и цену остальных иначе не измерить. Расплата: промпт меньше на всю tool-схему, поэтому такие числа не сопоставимы с боевыми и помечаются в истории «БЕЗ ТУЛОВ». Сравнивать их можно только между собой.
cerebras — те же веса gpt-oss-120b на своём железе; скидки на кэш промпта нет.
openai — кэшированный вход в 10 раз дешевле; с тулами доступен только effort=none.
grok — модели из анонса Grok 4.1 Fast сняты 15.05.2026 и молча обслуживаются grok-4.3 по его цене, поэтому здесь сразу grok-4.3: $1.25/$2.50 за 1M, кэш вход $0.20, четыре уровня размышления включая none, потолок токенов считает только видимый ответ. grok-4.20-0309-non-reasoning доступна через GROK_LLM_MODEL — старая зафиксированная non-reasoning модель, effort не настраивается.
openrouter — запрошенной thudm/glm-z1-32b:free в каталоге больше нет (404, семейство переехало под z-ai/). Бот ходит на бесплатную GLM 5.2, а бейк-офф — на платную: у бесплатной один апстрим, он отвечает 429 «rate-limited upstream», и даже успешный ответ мерил бы очередь общего бесплатного пула, а не нашу задержку.
cohere — свои веса, не gpt-oss. Самый дорогой: $3/$15 за 1M против $0.35/$0.75 у Cerebras, без скидки на кэш. Уровней размышления два (none/high), поэтому low и medium приводятся к none.
inworld — роутер поверх Groq: меряет накладные расходы маршрутизации, а не отдельный бэкенд.
groq — бесплатный тариф упирается в 8000 TPM — на нашем промпте это ~2 запроса подряд.
sambanova — те же веса на RDU; по Endpoint Accuracy Index точнее Groq и Cerebras.
fireworks_deepseek — DeepSeek V4 Flash: размышление включено по умолчанию (эффективно 'high'); API принимает 6 значений effort, реальных три — none/high/max, low/medium/xhigh тихо повышаются до них. Голый id без даты (-0731) не резолвится в API — 404, проверено 2026-08-20.
fireworks_nemotron — NVIDIA Nemotron Lightning: reasoning_effort у неё Fireworks НЕ документирует (нет в их таблице reasoning-моделей платформы) — код никогда не пытается настроить её размышление, поэтому у неё нет собственного ModelFamily и она попадает в DEFAULT_FAMILY. Её трейс размышления МОЖЕТ прийти прямо в content, а не в отдельном reasoning_content, как у документированных моделей — проверьте стенограмму прогона на /compare, прежде чем доверять её боевому звонку с TTS.
fireworks_minimax — MiniMax M2.7: у Fireworks в таблице reasoning-моделей платформы документирован только базовый 'MiniMax M2' (размышление всегда включено, только low/medium/high) — на дот-релиз M2.7 это распространяется НЕ подтверждённо, а карточка самой M2.7 говорит обратное ('не reasoning-модель'). Источники расходятся, поэтому код, как и с Nemotron, не пытается настраивать её размышление — безопаснее не слать недокументированный параметр, чем гадать.
fireworks_muse — Muse Glimmer 30B: плотная (не MoE) модель, не reasoning — reasoning_effort ей не шлём.
fireworks_gemma — ТРЕБУЕТ отдельного on-demand/dedicated деплоя в консоли Fireworks — это НЕ serverless-модель (нет строки в их общей таблице цен за токен, оплата почасовая за GPU). Одного FIREWORKS_API_KEY недостаточно: без поднятого деплоя запрос вернёт тот же 404 'Model not found, inaccessible, and/or not deployed', что уже случился с deepseek-v4-flash без даты.

Результат

провайдермодельeffort p50p95minmax ошибокpromt tok₽/запрос
прогона ещё не было
Ведущие колонки — перцентили, а не среднее: одна попавшая в очередь провайдера попытка из пяти сильно сдвигает среднее, но p50 остаётся тем, что происходит обычно. Та же формула, что на /stats, поэтому числа сравнимы напрямую.

История p50 по прогонам

когдаконфигзапросовпромпт +итог
загрузка…
Раньше результат показывался один раз и терялся. Теперь каждый прогон пишется, поэтому «стал ли Cerebras быстрее после того, как мы урезали промпт» — вопрос к таблице, а не к памяти.