llama.cpp b10603-b10615 — GLM-4.5-Air MTP, Deepseek 4 -sm tensor, тюнинг Metal flash-attn vec для M1 Pro/M2 Ultra/M5 Max
ggml-org
Серия master-сборок llama.cpp 23-24 августа. Из заметного: b10603 добавляет поддержку MTP (multi-token prediction) для GLM-4.5-Air; b10604 добавляет поддержку Deepseek 4 '-sm tensor'; b10608 исправляет mtmd-video moov atom в конце файла; b10610 укорачивает именование виртуальных устройств в CUDA и Metal; b10614 разделяет per-op Metal-исходники для параллельной компиляции и добавляет ядра для col2im_1d, set_rows, Q2_0, CONV_2D_DW, fused snake activation, FWHT; b10615 добавляет per-device тюнинг (Q, NE) flash-attn vec, включая FA-vec тюнинги для M1 Pro, M2 Ultra и M5 Max.
Почему это важно
GLM-4.5-Air MTP и Deepseek 4 -sm tensor — это модель-специфичные пути производительности, важные для всех, кто запускает эти архитектуры локально. Тюнинг Metal flash-attn vec для M5 Max — это взгляд в будущее: пользователи Apple silicon на новейших чипах получат ощутимые ускорения без изменения кода.
Важность: 2/5
default