hermes-hub/agents/reports/a54/local-model-review.md

2.4 KiB
Raw Permalink Blame History

A54 — локальная оркестрация

Использованы HTTP chat completions на 8082 (Qwen3-4B-Instruct-2507) и 8081 (Qwen3-Coder-30B-A3B), последовательно, без передачи данных владельца. Изолированный Git worktree; ответы моделей не исполнялись автоматически.

Циклы: probe-coder → probe-review → rework → review → rework; дополнительная передача сильному кодеру; preflight-coder → review → rework; Windows helper → review; отдельная генерация теста и ревью. Объёмы и время: local-model-usage.json (только сохранённые ответы; один потерянный ответ из-за ошибки оркестрационного скрипта не включён).

Итог аудита Codex

Модели не довели критические части до приемлемого состояния самостоятельно. 4B повторно оставляла отказ при enabled=False, использовала несуществующий threading.ThreadPoolExecutor, неправильно читала JSON Ollama. 30B тоже предлагала фиктивные профили и успешную проверку без вызова inference. Эти версии отклонены; конечный код существенно переработан Codex.

Ревью 30B полезно для поиска отдельных дефектов, но содержит ложные срабатывания. Например, оно объявляло нестабильным setdefault словаря блокировок под mutex и не признало отсутствие нужного импорта в предложенном тесте. Его PASS не принимался как достаточное основание.

Исправленная схема на этой задаче: локальные кандидаты → статическая проверка Codex → исправления → детерминированные тесты → браузерное исполнение → Windows CI. Нельзя утверждать, что расходы Codex снизились: контрольного замера без делегации нет.