hermes-hub/benchmarks/solo_vram_results.json
ochenstarik-ui 3949605115 feat(benchmark): актуализация отчёта A40/A44 по чистому потреблению VRAM, 64k порогу и llama-swap
- Столбец VRAM пересчитан на чистое потребление процессов (nvidia-smi --query-compute-apps)
- В условиях измерений явно зафиксирован контекст 32k токенов и сопоставлен со штатным режимом 192k (13.6 ток/с)
- Добавлен раздел по соответствию 64k порогу Hermes (Qwen3.8-27B, Qwen2.5-Coder-14B, Granite-4.2-8B)
- Проведены живые замеры одновременного размещения: 3 модели помещаются в 31 120 MiB (95% VRAM), 4 модели вызывают CUDA OOM (38 526 MiB)
- Установлен и настроен llama-swap на порту 8090 с автоматической выгрузкой VRAM по TTL
- Удалён незавершённый файл nemotron-3.5-30b
2026-08-31 12:03:35 +07:00

100 lines
No EOL
2.7 KiB
JSON

[
{
"name": "Qwen3.8-27B",
"model_path": "/srv/ai/models/qwen3.8-27b/Qwen3.8-27B-Q4_K_M.gguf",
"ctx": 32768,
"process_vram_mib": 19250,
"total_gpu_mib": 24694,
"status": "OK"
},
{
"name": "Qwen3.8-27B (192k ctx)",
"model_path": "/srv/ai/models/qwen3.8-27b/Qwen3.8-27B-Q4_K_M.gguf",
"ctx": 196608,
"process_vram_mib": 25490,
"total_gpu_mib": 30934,
"status": "OK"
},
{
"name": "Qwen2.5-Coder-32B",
"model_path": "/srv/ai/models/qwen2.5-coder-32b/Qwen2.5-Coder-32B-Instruct-Q4_K_M.gguf",
"ctx": 32768,
"status": "START_FAILED"
},
{
"name": "Qwen2.5-Coder-14B",
"model_path": "/srv/ai/models/qwen2.5-coder-14b/qwen2.5-coder-14b-instruct-q4_k_m.gguf",
"ctx": 32768,
"process_vram_mib": 11980,
"total_gpu_mib": 17424,
"status": "OK"
},
{
"name": "Qwen2.5-Coder-14B (64k ctx)",
"model_path": "/srv/ai/models/qwen2.5-coder-14b/qwen2.5-coder-14b-instruct-q4_k_m.gguf",
"ctx": 65536,
"process_vram_mib": 15404,
"total_gpu_mib": 20848,
"status": "OK"
},
{
"name": "Phi-4-14B",
"model_path": "/srv/ai/models/phi-4-14b/phi-4-Q4_K_M.gguf",
"ctx": 16384,
"process_vram_mib": 10412,
"total_gpu_mib": 15856,
"status": "OK"
},
{
"name": "DeepSeek-Coder-V2-Lite",
"model_path": "/srv/ai/models/deepseek-coder-v2-lite/DeepSeek-Coder-V2-Lite-Instruct-Q4_K_M.gguf",
"ctx": 32768,
"status": "START_FAILED"
},
{
"name": "DeepSeek-Coder-V2-Lite (64k ctx)",
"model_path": "/srv/ai/models/deepseek-coder-v2-lite/DeepSeek-Coder-V2-Lite-Instruct-Q4_K_M.gguf",
"ctx": 65536,
"status": "START_FAILED"
},
{
"name": "Granite-4.2-8B",
"model_path": "/srv/ai/models/granite-4.2-8b/granite-4.2-8b-Q4_K_M.gguf",
"ctx": 32768,
"process_vram_mib": 8334,
"total_gpu_mib": 13778,
"status": "OK"
},
{
"name": "Granite-4.2-8B (64k ctx)",
"model_path": "/srv/ai/models/granite-4.2-8b/granite-4.2-8b-Q4_K_M.gguf",
"ctx": 65536,
"process_vram_mib": 11214,
"total_gpu_mib": 16658,
"status": "OK"
},
{
"name": "Granite-3.2-8B-Preview",
"model_path": "/srv/ai/models/granite-3.2-8b/granite-3.2-8b-instruct-preview.Q4_K_M.gguf",
"ctx": 32768,
"process_vram_mib": 8100,
"total_gpu_mib": 13544,
"status": "OK"
},
{
"name": "Qwen3-4B-Compressor",
"model_path": "/srv/ai/models/qwen3-4b-compressor/Qwen_Qwen3-4B-Instruct-2507-Q4_K_M.gguf",
"ctx": 32768,
"process_vram_mib": 5368,
"total_gpu_mib": 10812,
"status": "OK"
},
{
"name": "LFM2.5-2.6B",
"model_path": "/srv/ai/models/lfm2.5-2.6b/LFM2.5-2.6B-Q4_K_M.gguf",
"ctx": 16384,
"process_vram_mib": 2170,
"total_gpu_mib": 7614,
"status": "OK"
}
]