llama.cpp v0.3.0 — первый помеченный стабильный релиз ночного b10621; мультимодальность dots3-note, MTP для GLM-4.5-Air, tensor-split DeepSeek 4, ggml v0.22.0
ggml-org
Стабильный тег-перелиз 25 августа, собран из ночного b10621. Поддержка новых моделей: dots3-note с новым типом KV-кэша DSA-ISWA (#27060); MTP (multi-token prediction) для GLM-4.5-Air (#26534); режим `-sm tensor` для DeepSeek 4 (#26490) и фикс отката с несколькими последовательностями (#26756); bailingmoe3 DSpark (#27508); in/out-проекции mamba2 сплющены для диспетчеризации GEMM вместо GEMV (#27513); `set_offset` RoPE используется в deepseek2/4, dflash, minicpm3, plm. mm: WebP через ffmpeg (#27520); видео с moov-атомом в конце файла исправлены (уже в b10608); Pillow-точный resize (#27594); vision и audio для dots3-note (#27524). Сервер: отладочный knob `LLAMA_SERVER_SLOTS_N_DIFF` (#27600); подгонка слотов переехала в общий `fit` с учётом `n_streams` (#27496); общая абстракция `json.h` (#27511). UI: tabbed-навигация для чат-разговоров (#27263). ggml v0.22.0: tensor-split для multi-backend (meta backend); per-op разбиение Metal-исходников для параллельной компиляции; `ggml_clamp` стал non-in-place; новые операции `POOL_1D`, `PAD_REFLECT_1D`; Q2_K SYCL-ядра; MoE bias fusion на OpenCL; разнообразные фиксы CUDA/Metal/SYCL/Vulkan/OpenCL/WebGPU. Заметные коммиты с v0.2.0: b10625-b10631 пререлизов добавили ROCm Ubuntu 24.04 CI, Apple RDMA RPC-транспорт, Metal OOM null-check, переработанную интеграцию kleidiai.
Почему это важно
v0.3.0 — официальный стабильный тег после серии b10603-b10615, уже покрытой вчера. Самостоятельная новизна релиза — мультимодальное семейство dots3-note и ggml v0.22.0 (Metal компилирует гораздо больше параллельно, так что время сборки и размер бинарника заметно меняются).
Важность: 3/5
Tagged stable-релиз llama.cpp с новым семейством моделей + мажорным бампом ggml