Mac Инструкции Искусственный интеллект
Apple показала, как запускать ИИ-агенты локально на Mac с помощью MLX [Видео]
Опубликовано , автор Shalom Levytam
Apple подробно рассказала разработчикам о том, как запускать рабочие процессы агентного искусственного интеллекта полностью на устройстве с помощью фреймворка MLX. На недавней сессии WWDC был представлен локальный программный стек, позволяющий ИИ-агентам работать непосредственно на оборудовании Mac без необходимости облачных вычислений или внешних API-ключей.
Эта конфигурация опирается на четыре программных уровня. В основе лежит MLX — разработанный Apple фреймворк для работы с массивами с открытым исходным кодом, созданный специально для объединенной памяти и аппаратного ускорения Apple Silicon. Уровнем выше находится MLX-LM для загрузки и тонкой настройки моделей, за которым следует MLX-LM Server. Поскольку этот серверный уровень предоставляет доступ к локальным моделям через HTTP-интерфейс, совместимый с OpenAI, Apple называет его прямой заменой облачным сервисам LLM. Это позволяет высокоуровневым агентным фреймворкам, таким как OpenCode или Xcode 27, взаимодействовать с локально развернутыми моделями по тому же протоколу, который обычно используется для облачных систем ИИ.
В ходе демонстраций Apple показала, как агент загружает пулл-реквесты с GitHub и локально формирует сводку изменений в коде. Компания также продемонстрировала агента, который с нуля создал работающее приложение на SwiftUI, скомпилировал проект и попутно исправил ошибки вплоть до успешного запуска программы.
Поддержание работы таких автономных процессов требует значительных вычислительных мощностей, особенно с учетом того, что агенты постоянно обрабатывают промпты и результаты работы инструментов, определяя свои следующие действия. Чтобы справиться с этой нагрузкой, Apple подчеркнула, что чип M5 оснащен специальными нейроускорителями, способными выполнять матричное умножение в четыре раза быстрее, чем M4. Фреймворк MLX задействует эти аппаратные преимущества, обеспечивая аналогичное 4-кратное ускорение обработки промптов. Программное обеспечение также использует непрерывный батчинг (continuous batching), группируя запросы от параллельных субагентов для их одновременной обработки на графическом процессоре, предотвращая задержки в очереди.
Для массивных моделей, требующих большего объема объединенной памяти, чем может предоставить один компьютер, MLX теперь поддерживает распределенный инференс. Разработчики могут распределить одну тяжелую модель — например, на 1,6 триллиона параметров, требующую более 800 ГБ оперативной памяти, — между несколькими Mac, объединенными через Ethernet или Thunderbolt. Используя Thunderbolt RDMA для связи с низкой задержкой, Apple продемонстрировала ускорение до 3 раз при объединении четырех компьютеров.
Такая возможность эффективно запускать производительные модели ИИ локально стала одной из главных причин, по которой Apple наблюдает всплеск спроса на Mac mini и Mac Studio. Как обычно, вы можете следить за наличием и ценами на компьютеры Mac с помощью сервиса Mac Price Tracker от iClarified.