22 сентября 2026

Mac Искусственный интеллект

Ollama задействует фреймворк Apple MLX для ускорения работы локального ИИ на Mac

Опубликовано , автор Shalom Levytam

Ollama выпустила предварительную сборку своего локального модуля запуска искусственного интеллекта, который интегрируется с фреймворком машинного обучения Apple MLX. Это обновление обеспечивает самую высокую на сегодняшний день производительность на чипах Apple silicon, ускоряя ресурсоемкие локальные рабочие нагрузки, такие как персональные ассистенты и автономные агенты для написания кода.

Ollama Taps Apple's MLX Framework for Faster Local AI on Mac

Переход на фреймворк MLX позволяет программе в полной мере задействовать архитектуру объединенной памяти Apple. Для пользователей, работающих на компьютерах с новейшими [чипами M5, M5 Pro и M5 Max], Ollama теперь использует встроенные графические нейроускорители (GPU Neural Accelerators) для уменьшения времени до первого токена и увеличения общей скорости генерации.

Обновление 0.19 также оптимизирует работу кэширования, повышая эффективность итеративных и агентных задач. Теперь Ollama может повторно использовать свой кэш в разных диалогах, что снижает потребление памяти и увеличивает количество успешных попаданий в кэш при разветвлении задач с такими кодинг-агентами, как [Codex], OpenCode или [Claude Code]. Интеллектуальные контрольные точки сохраняют снимки состояния в ключевые моменты подсказки для сокращения времени обработки, а обновленные политики вытеснения дольше удерживают общие префиксы в памяти при очистке старых ветвей.

Ollama Taps Apple's MLX Framework for Faster Local AI on Mac

Еще одним важным изменением стала поддержка формата NVIDIA NVFP4, который сохраняет точность модели, одновременно снижая требования к пропускной способности памяти и объему хранилища для рабочих нагрузок инференса. Поскольку все больше провайдеров инференса внедряют NVFP4 в массовом масштабе, добавление локальной поддержки помогает разработчикам лучше соответствовать производственным средам. Это также позволяет Ollama запускать модели, оптимизированные с помощью инструментария оптимизации моделей от NVIDIA.

Эта предварительная версия создана для ускорения работы новой модели Alibaba Qwen3.5-35B-A3B, причем параметры выборки настроены под задачи программирования с использованием таких ассистентов, как OpenClaw. Из-за размера и сложности модели для запуска этой превью-версии требуется Mac с объемом объединенной памяти более 32 ГБ.

Ollama заявляет, что работает над поддержкой дополнительных моделей и архитектур, а в будущих обновлениях планирует представить более простой способ импорта дообученных (fine-tuned) пользовательских моделей для разработчиков.

Ollama Taps Apple's MLX Framework for Faster Local AI on Mac

Mac. Читайте также на iClarified.ru.