Наработки из новостных сводок оседали в переписке и терялись. Заведён docs/research/: что рассмотрено для Hub, с вердиктом и причиной по каждому пункту — отдельно от ARCHITECTURE (что построено). Разбор Agent Orchestrator: ближайший архитектурный родственник Hub. Перенять автоматический возврат замечаний исполнителю (у нас его нет — ревьюер правит руками), ветку и worktree на работника, доску состояния флота; целиком не брать. Журнал разведки за 31.08–02.09: Fable 5.1 и AgentsView — брать; Hermes v0.21.0 — сервер обновлять последним (два бага, но 65536 у нас своё, не путать); Qwen MTP и свежий llama.cpp — на V100 выигрыша нет, проверено в A52. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
6.7 KiB
Журнал разведки
Что рассмотрено для Hermes Hub, с вердиктом и причиной. Причина важнее вердикта: она объясняет, почему решение такое, и не даёт вернуться к отвергнутому через месяц, забыв доводы.
Наша машина, чтобы вердикты были понятны: сервер — одна Tesla V100 32 ГиБ (Volta, sm_70), кодер Qwen3-Coder-30B-A3B занимает ~30 ГиБ из 32, свободно ~2. Провайдеры подключаются аккаунтами через хаб.
2026-09-02
Взять
Claude Fable 5.1 — новая frontier-модель Anthropic под длительные coding/agent-задачи. Цена $10 / $50 за миллион (вход/выход). Ложится на нашу маршрутизацию по ролям как ревьюер и второй кодер; на повседневное не ставить из-за цены. Проверяется через уже подключённый аккаунт Claude, отдельного провайдера не требует. Вердикт: протестировать на одной сложной задаче, сравнить с текущими кодером и ревьюером по времени, стоимости и качеству.
Внимание, не улучшение
Hermes Agent v0.21.0 — не обновлять сервер первым. В сводке два бага:
ollama_num_ctx может ограничить контекст облачного провайдера локальным
лимитом Ollama (в отчёте 65 536 при заявленном 1M); shutdown-watchdog зовёт
asyncio.start_unix_server, которого нет в родном Python под Windows. Проверено:
ни AF_UNIX, ни ollama_num_ctx в коде хаба нет — оба дефекта в самом Hermes
Agent, но хаб работает его плагином. Отдельно: 65 536 — это ещё и наше
запасное значение n_ctx в local_supervisor.query_server_props, когда /props
недоступен. Числа совпадают, дефекты разные — не перепутать при разборе.
Вердикт: сервер обновлять последним, после Windows-машины (canary first).
Перенять устройство
Agent Orchestrator (Apache 2.0, локальный) — ближайший родственник Hub. Подробный разбор: agent-orchestrator.md. Коротко: перенять автоматический возврат замечаний исполнителю (у нас его нет), ветку и worktree на работника, единую доску состояния флота; целиком не брать.
Наблюдаемость — паттерн NVIDIA BioNeMo / Claude Science: оркестратор + узкие инструменты вместо «одна модель делает всё». Архитектурно полезно для Кроны, не для Hub напрямую. Вердикт: держать в уме для Кроны.
Отложить
AgentsView (MIT, локальный, без аккаунта) — местная аналитика сессий coding-агентов: единый индекс, SQLite, токены и стоимость по агентам и датам, сбор с нескольких машин. Полезно: у нас теперь сессии на двух машинах и несколько исполнителей (Claude, Antigravity, Codex), и вопрос «куда ушли токены» встанет скоро. Риск низкий. Вердикт: протестировать локально, когда дойдут руки; не срочно, пока хаб не стабилизирован.
Не для нас сейчас
ARD (Agentic Resource Discovery) — слой обнаружения инструментов, чтобы не грузить весь каталог в prompt. Идея верная, но преждевременная: сначала хаб должен надёжно видеть подключённые аккаунты. Вердикт: следить за стандартом, не внедрять.
ComfyUI MCP, VoiceStudio, Gemini Agentic Video, DreamX-Creator — медиа и
видео. Не про Hermes Hub; относится к SMM/медийным проектам среди прочих
каталогов /srv/projects. Вердикт: не в Hub.
Rapid-MLX, MLX Workbench, CAVI MLX Agent — только Apple Silicon. Mac-узла нет. Вердикт: наблюдать до появления Mac.
2026-09-01
Проверять, а не брать на веру
llama.cpp свежие сборки (flash-attention под CUDA, shared-memory K/V, MoE-fusion). Новые пути CUDA обычно рассчитаны на Ampere и новее; V100 — Volta (sm_70), выигрыш не гарантирован. Вердикт: если пробовать — только с повторным замером тех же 107,4 ток/с на нашей сборке; по умолчанию не выигрыш.
Qwen3.8-27B MTP / спекулятивное декодирование — приведённые замеры на RTX 3090 и 5090. У нас черновой модели некуда встать: кодер занимает 30 ГиБ из 32. И в A52 уже измерено — две модели на одной V100 делят пропускную способность памяти 0,78–0,99×, ускорения нет. Вердикт: не тратить время на нашей машине.
Паттерн, не продукт
AWS Agent Toolkit — паттерн Skills + restricted MCP + policy + audit.
Совпадает с линией изоляции A37 и моделью безопасности (SECURITY_MODEL.md).
Вердикт: держать как ориентир для Tool/Skill-подсистемы, продукт не тащить.
TradingAgents v0.4.0 — не для Hub; идеи point-in-time (защита от заглядывания в будущее, historical snapshot, отметки времени в памяти решений) — для финансовых проектов. Вердикт: не в Hub, передать в торговые проекты.