Google DeepMind представляет Gemini Robotics ER 2 с функцией многороботизированного взаимодействия
Опубликовано , автор Shalom Levytam
Google DeepMind выпустила Gemini Robotics ER 2 — свою новейшую модель для воплощенного рассуждения (embodied reasoning), которая помогает роботам планировать сложные задачи, отслеживать их выполнение в реальном времени и взаимодействовать с другими машинами, адаптируясь к меняющимся условиям.

Модель выступает в роли физического агента высокого уровня, передавая потоковое видео, аудио и текст для координации действий в реальном времени, при этом делегируя моторное выполнение более низкоуровневым зрительно-языково-моторным (VLA) моделям. Она подключается через Gemini Live API с использованием двунаправленной конечной точки потоковой передачи, что позволяет роботам обдумывать предстоящие шаги, продолжая выполнять текущие задачи, вместо того чтобы делать паузы для размышлений между действиями. Разработчики также могут интегрировать такие инструменты, как Google Search или пользовательские функции, непосредственно в процесс рассуждения модели.
Важным обновлением стала темпоральная (временная) интеллектуальная составляющая, позволяющая роботам непрерывно отслеживать свой прогресс и распознавать, когда задача действительно выполнена. Gemini Robotics ER 2 достигает точности 57,4% при классификации непрерывного прогресса и 91,3% при поиске ключевых моментов, определяя точный кадр видео, в котором происходит критическое событие, со средней абсолютной погрешностью расстояния в 0,96 секунды.
По заявлению Google, это позволяет роботам переходить между задачами, проверять успешность их выполнения и повторять неудачные шаги без перезапуска целых рабочих процессов.
Еще одним крупным нововведением стала многороботная коллаборация, позволяющая роботам разных типов — например, колесному роверу и гуманоиду — общаться на основе общего семантического понимания и разделять сложные рабочие процессы, которые были бы сложны для одной машины.
Безопасность также была в центре внимания. Gemini Robotics ER 2 останавливает робота-гуманоида, когда рядом находится человек, и возобновляет работу только после того, как зона становится свободной. Она также превосходит Gemini Robotics ER 1.6 и другие передовые модели по бенчмаркам соблюдения инструкций по безопасности и нахождения вблизи людей.
Gemini Robotics ER 2 уже доступна разработчикам через Gemini API, Google AI Studio и в рамках закрытого предварительного просмотра на платформе Gemini Enterprise Agent Platform.