Наработки из новостных сводок оседали в переписке и терялись. Заведён docs/research/: что рассмотрено для Hub, с вердиктом и причиной по каждому пункту — отдельно от ARCHITECTURE (что построено). Разбор Agent Orchestrator: ближайший архитектурный родственник Hub. Перенять автоматический возврат замечаний исполнителю (у нас его нет — ревьюер правит руками), ветку и worktree на работника, доску состояния флота; целиком не брать. Журнал разведки за 31.08–02.09: Fable 5.1 и AgentsView — брать; Hermes v0.21.0 — сервер обновлять последним (два бага, но 65536 у нас своё, не путать); Qwen MTP и свежий llama.cpp — на V100 выигрыша нет, проверено в A52. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
94 lines
6.7 KiB
Markdown
94 lines
6.7 KiB
Markdown
# Журнал разведки
|
||
|
||
Что рассмотрено для Hermes Hub, с вердиктом и причиной. Причина важнее вердикта:
|
||
она объясняет, почему решение такое, и не даёт вернуться к отвергнутому через
|
||
месяц, забыв доводы.
|
||
|
||
Наша машина, чтобы вердикты были понятны: сервер — одна **Tesla V100 32 ГиБ**
|
||
(Volta, sm_70), кодер Qwen3-Coder-30B-A3B занимает ~30 ГиБ из 32, свободно ~2.
|
||
Провайдеры подключаются аккаунтами через хаб.
|
||
|
||
---
|
||
|
||
## 2026-09-02
|
||
|
||
### Взять
|
||
|
||
**Claude Fable 5.1** — новая frontier-модель Anthropic под длительные
|
||
coding/agent-задачи. Цена $10 / $50 за миллион (вход/выход). Ложится на нашу
|
||
маршрутизацию по ролям как ревьюер и второй кодер; на повседневное не ставить
|
||
из-за цены. Проверяется через уже подключённый аккаунт Claude, отдельного
|
||
провайдера не требует. **Вердикт: протестировать на одной сложной задаче,
|
||
сравнить с текущими кодером и ревьюером по времени, стоимости и качеству.**
|
||
|
||
### Внимание, не улучшение
|
||
|
||
**Hermes Agent v0.21.0** — не обновлять сервер первым. В сводке два бага:
|
||
`ollama_num_ctx` может ограничить контекст облачного провайдера локальным
|
||
лимитом Ollama (в отчёте 65 536 при заявленном 1M); shutdown-watchdog зовёт
|
||
`asyncio.start_unix_server`, которого нет в родном Python под Windows. Проверено:
|
||
ни `AF_UNIX`, ни `ollama_num_ctx` в коде хаба нет — оба дефекта в самом Hermes
|
||
Agent, но хаб работает его плагином. **Отдельно:** 65 536 — это ещё и наше
|
||
запасное значение `n_ctx` в `local_supervisor.query_server_props`, когда `/props`
|
||
недоступен. Числа совпадают, дефекты разные — не перепутать при разборе.
|
||
**Вердикт: сервер обновлять последним, после Windows-машины (canary first).**
|
||
|
||
### Перенять устройство
|
||
|
||
**Agent Orchestrator** (Apache 2.0, локальный) — ближайший родственник Hub.
|
||
Подробный разбор: [agent-orchestrator.md](agent-orchestrator.md). Коротко:
|
||
перенять автоматический возврат замечаний исполнителю (у нас его нет), ветку и
|
||
worktree на работника, единую доску состояния флота; целиком не брать.
|
||
|
||
**Наблюдаемость — паттерн NVIDIA BioNeMo / Claude Science:** оркестратор + узкие
|
||
инструменты вместо «одна модель делает всё». Архитектурно полезно для Кроны, не
|
||
для Hub напрямую. **Вердикт: держать в уме для Кроны.**
|
||
|
||
### Отложить
|
||
|
||
**AgentsView** (MIT, локальный, без аккаунта) — местная аналитика сессий
|
||
coding-агентов: единый индекс, SQLite, токены и стоимость по агентам и датам,
|
||
сбор с нескольких машин. Полезно: у нас теперь сессии на двух машинах и
|
||
несколько исполнителей (Claude, Antigravity, Codex), и вопрос «куда ушли токены»
|
||
встанет скоро. Риск низкий. **Вердикт: протестировать локально, когда дойдут
|
||
руки; не срочно, пока хаб не стабилизирован.**
|
||
|
||
### Не для нас сейчас
|
||
|
||
**ARD (Agentic Resource Discovery)** — слой обнаружения инструментов, чтобы не
|
||
грузить весь каталог в prompt. Идея верная, но преждевременная: сначала хаб
|
||
должен надёжно видеть подключённые аккаунты. **Вердикт: следить за стандартом,
|
||
не внедрять.**
|
||
|
||
**ComfyUI MCP, VoiceStudio, Gemini Agentic Video, DreamX-Creator** — медиа и
|
||
видео. Не про Hermes Hub; относится к SMM/медийным проектам среди прочих
|
||
каталогов `/srv/projects`. **Вердикт: не в Hub.**
|
||
|
||
**Rapid-MLX, MLX Workbench, CAVI MLX Agent** — только Apple Silicon. Mac-узла
|
||
нет. **Вердикт: наблюдать до появления Mac.**
|
||
|
||
---
|
||
|
||
## 2026-09-01
|
||
|
||
### Проверять, а не брать на веру
|
||
|
||
**llama.cpp свежие сборки** (flash-attention под CUDA, shared-memory K/V,
|
||
MoE-fusion). Новые пути CUDA обычно рассчитаны на Ampere и новее; V100 — Volta
|
||
(sm_70), выигрыш не гарантирован. **Вердикт: если пробовать — только с повторным
|
||
замером тех же 107,4 ток/с на нашей сборке; по умолчанию не выигрыш.**
|
||
|
||
**Qwen3.8-27B MTP / спекулятивное декодирование** — приведённые замеры на RTX
|
||
3090 и 5090. У нас черновой модели некуда встать: кодер занимает 30 ГиБ из 32. И
|
||
в A52 уже измерено — две модели на одной V100 делят пропускную способность
|
||
памяти 0,78–0,99×, ускорения нет. **Вердикт: не тратить время на нашей машине.**
|
||
|
||
### Паттерн, не продукт
|
||
|
||
**AWS Agent Toolkit** — паттерн `Skills + restricted MCP + policy + audit`.
|
||
Совпадает с линией изоляции A37 и моделью безопасности (`SECURITY_MODEL.md`).
|
||
**Вердикт: держать как ориентир для Tool/Skill-подсистемы, продукт не тащить.**
|
||
|
||
**TradingAgents v0.4.0** — не для Hub; идеи point-in-time (защита от заглядывания
|
||
в будущее, historical snapshot, отметки времени в памяти решений) — для
|
||
финансовых проектов. **Вердикт: не в Hub, передать в торговые проекты.**
|