#local-inference
- Google выпускает DiffusionGemma: открытая модель на 26B с генерацией текста в 4× быстрее Google DeepMind models-llm
- llama.cpp b9754: прогресс загрузки модели в реальном времени через SSE и PEG-парсер грамматик tools
- llama.cpp выпускает pre-release v0.1.2 плюс ежедневные b10483–b10488 с исправлением производительности SYCL, обновлением OpenVINO и тюнингом CUDA для DGX Spark llama.cpp (GGML) tools