Ollama задействует фреймворк Apple MLX для ускорения работы локального ИИ на Mac
Опубликовано , автор Shalom Levytam
Ollama выпустила предварительную сборку своего локального модуля запуска искусственного интеллекта, который интегрируется с фреймворком машинного обучения Apple MLX. Это обновление обеспечивает самую высокую на сегодняшний день производительность на чипах Apple silicon, ускоряя ресурсоемкие локальные рабочие нагрузки, такие как персональные ассистенты и автономные агенты для написания кода.

Переход на фреймворк MLX позволяет программе в полной мере задействовать архитектуру объединенной памяти Apple. Для пользователей, работающих на компьютерах с новейшими [чипами M5, M5 Pro и M5 Max], Ollama теперь использует встроенные графические нейроускорители (GPU Neural Accelerators) для уменьшения времени до первого токена и увеличения общей скорости генерации.
Обновление 0.19 также оптимизирует работу кэширования, повышая эффективность итеративных и агентных задач. Теперь Ollama может повторно использовать свой кэш в разных диалогах, что снижает потребление памяти и увеличивает количество успешных попаданий в кэш при разветвлении задач с такими кодинг-агентами, как [Codex], OpenCode или [Claude Code]. Интеллектуальные контрольные точки сохраняют снимки состояния в ключевые моменты подсказки для сокращения времени обработки, а обновленные политики вытеснения дольше удерживают общие префиксы в памяти при очистке старых ветвей.

Еще одним важным изменением стала поддержка формата NVIDIA NVFP4, который сохраняет точность модели, одновременно снижая требования к пропускной способности памяти и объему хранилища для рабочих нагрузок инференса. Поскольку все больше провайдеров инференса внедряют NVFP4 в массовом масштабе, добавление локальной поддержки помогает разработчикам лучше соответствовать производственным средам. Это также позволяет Ollama запускать модели, оптимизированные с помощью инструментария оптимизации моделей от NVIDIA.
Эта предварительная версия создана для ускорения работы новой модели Alibaba Qwen3.5-35B-A3B, причем параметры выборки настроены под задачи программирования с использованием таких ассистентов, как OpenClaw. Из-за размера и сложности модели для запуска этой превью-версии требуется Mac с объемом объединенной памяти более 32 ГБ.
Ollama заявляет, что работает над поддержкой дополнительных моделей и архитектур, а в будущих обновлениях планирует представить более простой способ импорта дообученных (fine-tuned) пользовательских моделей для разработчиков.
