Google Gemini для Mac получил голосовой ввод и команды ИИ с учетом содержимого экрана
Опубликовано , автор Shalom Levytam
Google выпускает новый голосовой режим для своего приложения Gemini на Mac. Удерживайте клавишу Fn и говорите — Gemini расшифровывает речь напрямую в активное приложение, а опциональный ИИ с поддержкой анализа экрана позволяет выполнять более сложные команды.

В своем блоге компания Google рассказала о том, как работает эта функция. По умолчанию интеллектуальная диктовка преобразует речь в чистый, отредактированный текст. Она удаляет слова-паразиты вроде «э-э» и учитывает исправления прямо по ходу предложения перед вставкой отформатированного текста непосредственно в позицию курсора.
Пользователи также могут включить в настройках рассуждения с учетом содержимого экрана. После активации Gemini сможет понимать контекст на вашем экране для обработки более сложных голосовых запросов. Например, вы можете попросить его: «прочитай эти ветеринарные файлы и обобщи историю болезни моей собаки в письме для передержки» или «преврати эти заметки в краткую сводку с выжимкой (TL;DR) в начале». Gemini также может создавать или редактировать изображения по голосовым запросам, например, создавать темную версию дизайна, который уже открыт на экране.
Компания Google выпустила нативное приложение Gemini для Mac в апреле. Сначала оно предлагало сочетание клавиш и инструменты с управлением разрешениями для анализа содержимого экрана. Позже компания переработала дизайн приложения вокруг своего AI-агента Spark и добавила доступ к локальным файлам и функции автоматизации. Новый голосовой режим дополняет эти возможности, позволяя пользователям создавать, редактировать и обобщать контент с помощью голоса, не покидая используемое в данный момент приложение.
Голосовая функция становится доступна по всему миру для всех пользователей приложения Gemini для macOS на английском языке. В компании Google сообщили, что поддержка других языков появится в ближайшее время.
