Commit graph

1 commit

Author SHA1 Message Date
Hermes Team
f8b6783641 docs(agents): задание A39 — параметры запроса для локальных профилей
Локальная модель не закрывает задачи: Hermes сообщает о таймауте 180 секунд
после четырёх вызовов и переключается на другого провайдера.

Причина измерена, а не предположена. Служба запущена с --reasoning on и
--reasoning-budget 4096, а модель выдаёт 13,4 токена в секунду. На простой
задаче рефакторинга с лимитом 1500 токенов получено:

    сгенерировано  1500 токенов за 111,6 с
    рассуждений    5483 символа
    ответа         0 символов

Весь лимит уходит на размышления, до ответа модель не доходит. За 180 секунд
она успевает около 2400 токенов — и это тоже одни рассуждения.

Отключение рассуждений на уровне запроса проверено и работает:

    reasoning_effort: none                        ответ за 19,5 с
    chat_template_kwargs: enable_thinking=false   ответ за 11,4 с

Одиннадцать секунд вместо ста одиннадцати. Серверный флаг --reasoning off
решил бы это грубо, лишив рассуждений насовсем, поэтому владелец выбрал
гибкий путь: параметры задаёт хаб, по профилю.

Задание требует не зашивать ни enable_thinking, ни reasoning_effort: набор
ключей зависит от версии llama.cpp, и это данные конфигурации, а не
константы кода. Отдельным критерием — проверка живым запросом к серверу
владельца с замером времени до и после.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-30 23:04:18 +07:00