2.4 KiB
A54 — локальная оркестрация
Использованы HTTP chat completions на 8082 (Qwen3-4B-Instruct-2507) и 8081 (Qwen3-Coder-30B-A3B), последовательно, без передачи данных владельца. Изолированный Git worktree; ответы моделей не исполнялись автоматически.
Циклы: probe-coder → probe-review → rework → review → rework; дополнительная передача сильному кодеру; preflight-coder → review → rework; Windows helper → review; отдельная генерация теста и ревью. Объёмы и время: local-model-usage.json (только сохранённые ответы; один потерянный ответ из-за ошибки оркестрационного скрипта не включён).
Итог аудита Codex
Модели не довели критические части до приемлемого состояния самостоятельно. 4B повторно оставляла отказ при enabled=False, использовала несуществующий threading.ThreadPoolExecutor, неправильно читала JSON Ollama. 30B тоже предлагала фиктивные профили и успешную проверку без вызова inference. Эти версии отклонены; конечный код существенно переработан Codex.
Ревью 30B полезно для поиска отдельных дефектов, но содержит ложные срабатывания. Например, оно объявляло нестабильным setdefault словаря блокировок под mutex и не признало отсутствие нужного импорта в предложенном тесте. Его PASS не принимался как достаточное основание.
Исправленная схема на этой задаче: локальные кандидаты → статическая проверка Codex → исправления → детерминированные тесты → браузерное исполнение → Windows CI. Нельзя утверждать, что расходы Codex снизились: контрольного замера без делегации нет.