hermes-hub/docs/research/scouting-log.md
Hermes Team ef00a64f93 docs(research): каталог разведки — разбор Agent Orchestrator и журнал наблюдений
Наработки из новостных сводок оседали в переписке и терялись. Заведён
docs/research/: что рассмотрено для Hub, с вердиктом и причиной по каждому
пункту — отдельно от ARCHITECTURE (что построено).

Разбор Agent Orchestrator: ближайший архитектурный родственник Hub. Перенять
автоматический возврат замечаний исполнителю (у нас его нет — ревьюер правит
руками), ветку и worktree на работника, доску состояния флота; целиком не брать.

Журнал разведки за 31.08–02.09: Fable 5.1 и AgentsView — брать; Hermes v0.21.0 —
сервер обновлять последним (два бага, но 65536 у нас своё, не путать);
Qwen MTP и свежий llama.cpp — на V100 выигрыша нет, проверено в A52.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-09-02 19:17:44 +07:00

6.7 KiB
Raw Blame History

Журнал разведки

Что рассмотрено для Hermes Hub, с вердиктом и причиной. Причина важнее вердикта: она объясняет, почему решение такое, и не даёт вернуться к отвергнутому через месяц, забыв доводы.

Наша машина, чтобы вердикты были понятны: сервер — одна Tesla V100 32 ГиБ (Volta, sm_70), кодер Qwen3-Coder-30B-A3B занимает ~30 ГиБ из 32, свободно ~2. Провайдеры подключаются аккаунтами через хаб.


2026-09-02

Взять

Claude Fable 5.1 — новая frontier-модель Anthropic под длительные coding/agent-задачи. Цена $10 / $50 за миллион (вход/выход). Ложится на нашу маршрутизацию по ролям как ревьюер и второй кодер; на повседневное не ставить из-за цены. Проверяется через уже подключённый аккаунт Claude, отдельного провайдера не требует. Вердикт: протестировать на одной сложной задаче, сравнить с текущими кодером и ревьюером по времени, стоимости и качеству.

Внимание, не улучшение

Hermes Agent v0.21.0 — не обновлять сервер первым. В сводке два бага: ollama_num_ctx может ограничить контекст облачного провайдера локальным лимитом Ollama (в отчёте 65 536 при заявленном 1M); shutdown-watchdog зовёт asyncio.start_unix_server, которого нет в родном Python под Windows. Проверено: ни AF_UNIX, ни ollama_num_ctx в коде хаба нет — оба дефекта в самом Hermes Agent, но хаб работает его плагином. Отдельно: 65 536 — это ещё и наше запасное значение n_ctx в local_supervisor.query_server_props, когда /props недоступен. Числа совпадают, дефекты разные — не перепутать при разборе. Вердикт: сервер обновлять последним, после Windows-машины (canary first).

Перенять устройство

Agent Orchestrator (Apache 2.0, локальный) — ближайший родственник Hub. Подробный разбор: agent-orchestrator.md. Коротко: перенять автоматический возврат замечаний исполнителю (у нас его нет), ветку и worktree на работника, единую доску состояния флота; целиком не брать.

Наблюдаемость — паттерн NVIDIA BioNeMo / Claude Science: оркестратор + узкие инструменты вместо «одна модель делает всё». Архитектурно полезно для Кроны, не для Hub напрямую. Вердикт: держать в уме для Кроны.

Отложить

AgentsView (MIT, локальный, без аккаунта) — местная аналитика сессий coding-агентов: единый индекс, SQLite, токены и стоимость по агентам и датам, сбор с нескольких машин. Полезно: у нас теперь сессии на двух машинах и несколько исполнителей (Claude, Antigravity, Codex), и вопрос «куда ушли токены» встанет скоро. Риск низкий. Вердикт: протестировать локально, когда дойдут руки; не срочно, пока хаб не стабилизирован.

Не для нас сейчас

ARD (Agentic Resource Discovery) — слой обнаружения инструментов, чтобы не грузить весь каталог в prompt. Идея верная, но преждевременная: сначала хаб должен надёжно видеть подключённые аккаунты. Вердикт: следить за стандартом, не внедрять.

ComfyUI MCP, VoiceStudio, Gemini Agentic Video, DreamX-Creator — медиа и видео. Не про Hermes Hub; относится к SMM/медийным проектам среди прочих каталогов /srv/projects. Вердикт: не в Hub.

Rapid-MLX, MLX Workbench, CAVI MLX Agent — только Apple Silicon. Mac-узла нет. Вердикт: наблюдать до появления Mac.


2026-09-01

Проверять, а не брать на веру

llama.cpp свежие сборки (flash-attention под CUDA, shared-memory K/V, MoE-fusion). Новые пути CUDA обычно рассчитаны на Ampere и новее; V100 — Volta (sm_70), выигрыш не гарантирован. Вердикт: если пробовать — только с повторным замером тех же 107,4 ток/с на нашей сборке; по умолчанию не выигрыш.

Qwen3.8-27B MTP / спекулятивное декодирование — приведённые замеры на RTX 3090 и 5090. У нас черновой модели некуда встать: кодер занимает 30 ГиБ из 32. И в A52 уже измерено — две модели на одной V100 делят пропускную способность памяти 0,780,99×, ускорения нет. Вердикт: не тратить время на нашей машине.

Паттерн, не продукт

AWS Agent Toolkit — паттерн Skills + restricted MCP + policy + audit. Совпадает с линией изоляции A37 и моделью безопасности (SECURITY_MODEL.md). Вердикт: держать как ориентир для Tool/Skill-подсистемы, продукт не тащить.

TradingAgents v0.4.0 — не для Hub; идеи point-in-time (защита от заглядывания в будущее, historical snapshot, отметки времени в памяти решений) — для финансовых проектов. Вердикт: не в Hub, передать в торговые проекты.