22 сентября 2026

Искусственный интеллект

Модель Astra от OpenAI преодолела «критический» порог кибербезопасности, что привело к паузе в мерах безопасности

Опубликовано , автор Shalom Levytam

OpenAI приостановила некоторые внутренние работы над своей моделью нового поколения Astra после того, как внутренние оценки показали, что компания не может исключать достижения системой «критического» уровня возможностей в сфере кибербезопасности согласно ее Ранкам готовности (Preparedness Framework).

OpenAI's Astra Model Hits 'Critical' Cybersecurity Threshold, Prompting Safety Pause

Недавние внутренние тесты показали, что Astra добилась значительных успехов в сфере агентного написания кода (agentic coding) и кибербезопасности, причем производительность оказалась настолько высокой, что OpenAI не может исключить достижения «критического» уровня возможностей. В опубликованном в пятницу блоге компания пояснила, что этот порог достигается, когда модель способна самостоятельно выявлять и разрабатывать функциональные эксплойты нулевого дня всех уровней опасности для множества защищенных критически важных реальных систем, либо разрабатывать и осуществлять комплексные новые стратегии кибератак на укрепленные цели, получая на вход лишь общую желаемую цель.

В OpenAI заявили, что Astra не участвовала в атаке на Hugging Face во время внутреннего тестирования. Чтобы снизить риски, связанные с появлением все более способных моделей, компания внедряет более строгие меры безопасности. Они включают в себя изолированные среды тестирования, ограниченный доступ к сети и инструментам, усиленную защиту и шифрование весов модели, дополнительные возможности мониторинга и обнаружения, а также изолированное (песочное) выполнение кода. Компания также приостанавливает работу с Astra, которая не соответствует этим ужесточенным требованиям безопасности, и внедрила универсальный мониторинг рискованных действий и отклонений от заданного поведения во всех агентских приложениях модели, включая обучение и оценку.

В OpenAI отметили, что делятся этими результатами, поскольку считают «важным проявлять прозрачность перед общественностью, а также сообществами специалистов по безопасности в отношении этого потенциального изменения возможностей». Это заявление последовало за несколькими недавними новостями о передовых ИИ-моделях с расширенными возможностями. Ранее этим летом правительство США обязало компанию Anthropic приостановить работу моделей Claude Fable 5 и Mythos 5 из-за их кибервозможностей. Позже ограничения были сняты, что позволило Anthropic восстановить доступ к обеим моделям после внедрения дополнительных мер безопасности.

В дальнейшем OpenAI планирует работать с профильными правительственными ведомствами и избранными организациями по безопасности ИИ для дополнительной оценки модели. Компания также предоставит рекомендуемые средства контроля безопасности сторонним партнерам по тестированию для безопасного проведения оценок и рабочих нагрузок с повышенным риском. «Мы стремимся работать бок о бок с правительствами, институтами безопасности и гражданским обществом, чтобы гарантировать, что передовые возможности таких моделей, как Astra, и тех, что появятся после нее, будут развертываться ответственно и на благо всего человечества».

Искусственный интеллект. Читайте также на iClarified.ru.