#performance
- Hugging Face Transformers: асинхронный continuous batching даёт прирост скорости инференса на 22% Hugging Face tools
- Dharma-AI поднимает утилизацию GPU-кластера с 53,6% до 87,0%, кодируя физические ограничения в планировщик Dharma-AI tools
- llama.cpp выпускает pre-release v0.1.2 плюс ежедневные b10483–b10488 с исправлением производительности SYCL, обновлением OpenVINO и тюнингом CUDA для DGX Spark llama.cpp (GGML) tools
- llama.cpp b10603-b10615 — GLM-4.5-Air MTP, Deepseek 4 -sm tensor, тюнинг Metal flash-attn vec для M1 Pro/M2 Ultra/M5 Max ggml-org tools