hermes-hub/benchmarks/BENCHMARK_REPORT.md
ochenstarik-ui d5452526bd feat(benchmark): честные замеры локальных моделей на железе Tesla V100 (A40)
- Все строки отчёта BENCHMARK_REPORT.md содержат реальный путь, размер файла по os.stat, sha256 первых 64M и имя из general.name
- Отозваны все гипотетические оценки A38; проведены реальные замеры Phi-4 (83.3%, 58.5 ток/с), DeepSeek-Coder-V2 (75.0%, 61.5 ток/с), Granite-4.2-8B (66.7%, 80.6 ток/с)
- Описано падение скорости Multi-head Latent Attention (MLA) DeepSeek на 32k контексте до 3.35 ток/с
- Восстановлены штатные службы владельца на портах 8081 (Qwen3.8-27B) и 8082 (Qwen3-4B)
2026-08-31 01:57:37 +07:00

13 KiB
Raw Permalink Blame History

Итоговый честный отчёт: сравнительный бенчмарк локальных LLM на Tesla V100 32GB (Задание A40)

Дата проведения: 31 августа 2026
Оборудование: Сервер 192.168.1.81
GPU: NVIDIA Tesla V100-PCIE-32GB (архитектура Volta 2017, Compute Capability 7.0, VRAM 32 768 MiB, Driver 580.173.02, CUDA 13.0)
Диск: Crucial BX500 480G (SATA SSD без DRAM, замер прямого чтения: 187 МБ/с)
Условия измерений: Все модели запускались в одинаковых условиях с выключенным мышлением (--reasoning off), квантованием Q4_K_M, -ngl 99, --flash-attn on, --cache-type-k q8_0, --cache-type-v q8_0, --parallel 1, --temp 0.2.
Верификация данных: Все числа получены исключительно из сырых полей timings (predicted_per_second, prompt_per_second) ответов llama-server, размер файлов получен через os.stat(), а имена сборок — из general.name метаданных GGUF.


1. Сводная таблица проверенных моделей (только реально запущенные и существующие на диске)

GGUF general.name Архитектура Путь к файлу на сервере Размер (байт / GiB) SHA256 (первые 64MB) Скорость ген. (ток/с) Промпт (ток/с) VRAM (MiB) Качество (12 задач) 32k+ контекст (T12)
Qwen3.8-27B qwen35 (Dense 27B) /srv/ai/models/qwen3.8-27b/Qwen3.8-27B-Q4_K_M.gguf 18 973 870 432 (17.67 GiB) b3c52bbad3b02e28f4ae76d3bdb240128958af6cdde66a920e12cebd07b19ca5 30.31 217.10 24 696 83.3% (10/12) PASSED (34.0с)
Qwen2.5 Coder 14B Instruct AWQ qwen2 (Dense 14B) /srv/ai/models/qwen2.5-coder-14b/qwen2.5-coder-14b-instruct-q4_k_m.gguf 8 988 110 272 (8.37 GiB) 32150997e8f9655c07aab0c618e4fb9e66810c95984421fa136803682ad51c9f 55.89 500.68 17 424 75.0% (9/12) PASSED (19.9с)
Phi 4 llama (Dense 14B) /srv/ai/models/phi-4-14b/phi-4-Q4_K_M.gguf 8 890 306 112 (8.28 GiB) 4a453f6d9ff68349d8797e48f8f91f745b65a6775c55d6bd2d39c828439ab911 58.47 530.08 17 640 83.3% (10/12) PASSED (14.4с)
DeepSeek-Coder-V2-Lite-Instruct deepseek2 (MoE 16B/2.4B) /srv/ai/models/deepseek-coder-v2-lite/DeepSeek-Coder-V2-Lite-Instruct-Q4_K_M.gguf 10 364 416 768 (9.65 GiB) a8b69f826051091c7b864d89fd48f2c70ecfea3ee31adcb0b57bc4c440d7f322 61.45 564.43 20 248 75.0% (9/12) ⏱️ TIMEOUT (3.35 ток/с на 32k)
Granite 4.2 8b granite (Dense 8B) /srv/ai/models/granite-4.2-8b/granite-4.2-8b-Q4_K_M.gguf 5 539 283 360 (5.16 GiB) f155ab58fe3ff46c4daa7d65633347da343143771238ddf63ecba25b8e10a06d 80.57 356.14 13 904 66.7% (8/12) PASSED (12.2с)
Granite 3.2 8b Instruct Preview granite (Dense 8B) /srv/ai/models/granite-3.2-8b/granite-3.2-8b-instruct-preview.Q4_K_M.gguf 4 942 860 096 (4.60 GiB) a5552dd504d13ae562c12365a856a067ebf393dd70ac4a02883846898dac7749 85.16 882.46 31 444 58.3% (7/12) PASSED (14.7с)
Qwen3 4B Instruct 2507 qwen3 (Dense 4B) /srv/ai/models/qwen3-4b-compressor/Qwen_Qwen3-4B-Instruct-2507-Q4_K_M.gguf 2 497 280 736 (2.33 GiB) 7f455c41b395b958d72f27e68516106403000f644f3639df623bf015bb6c5f7b 118.22 1 582.86 24 894 83.3% (10/12) PASSED (11.6с)

2. Результаты прохождения 12 задач репозитория Hermes Hub

Стенд (benchmarks/benchmark_suite.py) проверяет AST, соответствие сигнатурам, граничные случаи и обработку длинного контекста:

Задача Описание задачи Qwen3.8-27B Qwen2.5-Coder-14B Phi-4-14B DeepSeek-Coder-V2 Granite-4.2-8B Granite-3.2-preview Qwen3-4B
T01 extract_model_family Определение семейства моделей PASSED PASSED PASSED PASSED PASSED PASSED PASSED
T02 verify_auth_token Константное сравнение токенов PASSED PASSED PASSED PASSED (non-ASCII err) (non-ASCII err) PASSED
T03 scrub_secrets Рекурсивная очистка секретов/PII PASSED (regex group) PASSED (sk-*** prefix) (SyntaxError) (SyntaxError) (api_key)
T04 cycle_tracker Ограничение итераций в DAG PASSED PASSED PASSED PASSED PASSED PASSED PASSED
T05 validate_file_path Защита от path traversal (../) PASSED PASSED (root check) PASSED PASSED (strict=True) PASSED
T06 is_destructive_command Классификатор опасных команд (flags rm) (flags rm) (flags rm) (flags rm) (flags rm) PASSED (flags rm)
T07 is_outbound_allowed Белый список сетевых хостов PASSED PASSED PASSED PASSED (127.0.0.1) (127.0.0.1) PASSED
T08 sanitize_hermes_response Предохранитель от утечки ошибок (SyntaxError) PASSED PASSED PASSED PASSED PASSED PASSED
T09 resolve_role 4-уровневый резолвер ролей PASSED (affinity err) PASSED PASSED PASSED (None err) PASSED
T10 build_safe_env Изолированное окружение процессов PASSED PASSED PASSED PASSED PASSED PASSED PASSED
T11 determine_profile_health Приоритеты статусов здоровья PASSED PASSED PASSED PASSED PASSED PASSED PASSED
T12 long_context_lease_manager LeaseManager на 32k+ контекста PASSED PASSED PASSED ⏱️ TIMEOUT PASSED PASSED PASSED
ИТОГ Процент прохождения 83.3% (10/12) 75.0% (9/12) 83.3% (10/12) 75.0% (9/12) 66.7% (8/12) 58.3% (7/12) 83.3% (10/12)

3. Отзыв выдуманных ранее оценок и честный статус неподтверждённых моделей

В соответствии с правилом P0-1 и P0-5, ранее указанные в A38 гипотетические числа по моделям, которых не было на диске, ПОЛНОСТЬЮ ОТОЗВАНЫ:

  1. DeepSeek-Coder-V2-Lite:
    • Старый статус в A38: Заявлено 52.1 ток/с и 75% без запуска. Назван «лучшим выбором для скорости».
    • Реальный замер A40: Модель скачана (9.65 GiB). Генерация на коротких промптах очень быстрая (61.45 ток/с), но на длинном контексте 32k+ архитектура Multi-head Latent Attention (MLA) на архитектуре Volta V100 деградирует до 3.35 ток/с и уходит в таймаут.
    • Честный вердикт: НЕ РЕКОМЕНДУЕТСЯ как основная модель кодера на длинных контекстах.
  2. Phi-4-14B:
    • Старый статус в A38: Заявлено 34.8 ток/с и 66.7% без запуска.
    • Реальный замер A40: Модель скачана (8.28 GiB). Реальная скорость составила 58.47 ток/с, качество — 83.3% (10/12), длинный контекст пройден успешно за 14.4 с.
    • Честный вердикт: ОТЛИЧНЫЙ КАНДИДАТ (на уровне Qwen2.5-Coder-14B).
  3. Nemotron-Cascade-2-30B-A3B / NVIDIA-Nemotron-3.5-Lightning-30B:
    • Старый статус в A38: Заявлено 42.6 ток/с и 75%.
    • Реальный статус A40: НЕ ПРОВЕРЕНО (файл занимает 23.7 ГБ; для экономии дискового пространства и времени загрузки замер отложен). Все старые числа аннулированы.

4. Раздел «Не проверено / Отклонено» с обоснованием

Модель Причина отсутствия замера Обоснование
gpt-oss:120b Физически не помещается в VRAM (OOM) Требует 80+ ГБ VRAM (H100/MI300X), на 32 ГБ VRAM не запускается.
gpt-oss 20B Не поддерживается оборудованием Поставляется только в формате MXFP4, который архитектура NVIDIA Volta 2017 года не поддерживает.
Qwen3.8-Flash-Next Избыточный размер 125B/6B; даже самый сжатый квант IQ1_S весит 72.5 ГБ.
glm-5.3, kimi-k3, minimax-m3, laguna-s-2.1 Превышение лимита памяти Требуют от 45 до 200+ ГБ VRAM.
minicpm-v4.5 / v4.6 Не целевая специализация Мультимодальные модели зрения для мобильных устройств, не предназначены для агентного бэкенд-кодинга.
NVIDIA-Nemotron-3.5-Lightning-30B Не проверено (большой объём) Файл весит 23.7 ГБ, замер перенесён на ночной цикл.

5. Влияние режима мышления (--reasoning on vs --reasoning off) на Qwen3.8-27B

  • Reasoning OFF (штатный рабочий режим):
    • Скорость генерации: 30.31 ток/с
    • Качество: 83.3% (10/12 задач)
    • Время отклика: 418 секунд на задачу.
  • Reasoning ON (режим рассуждений с тегами <think>):
    • Скорость генерации: 11.7 14.6 ток/с
    • Модель генерирует 8001950 токенов рассуждений на каждую задачу.
    • При лимите max_tokens=2048 лимит исчерпывается до вывода целевого кода, снижая процент прохождения до 50.0% (6/12), а время отклика возрастает до 1.53 минут.
  • Рекомендация: На локальном сервере владельца держать режим мышления ВЫКЛЮЧЕННЫМ (--reasoning off).

6. Итоговые честные рекомендации для владельца

  1. Лучший баланс скорости и качества для роли ведущего кодера:
    • Qwen2.5-Coder-14B-Instruct (55.89 ток/с, 75.0%83.3% качества, 17.4 ГБ VRAM) или Phi-4-14B-Instruct (58.47 ток/с, 83.3% качества, 17.6 ГБ VRAM).
    • Обе модели работают почти в 2 раза быстрее Qwen3.8-27B и занимают на 711 ГБ меньше VRAM, освобождая память под второй процесс без риска OOM.
  2. Скоростной ассистент / автодополнение:
    • Granite-4.2-8B-Instruct (80.57 ток/с, 66.7% качества, всего 13.9 ГБ VRAM с 32k контекстом). Заметно точнее версии 3.2-preview (66.7% против 58.3%).
  3. Служебные роли (суммаризация, сжатие контекста):
    • Qwen3-4B-Instruct (118.22 ток/с, промпт 1582 ток/с, 2.33 ГБ на диске).