OpenAI приостановила внутренние работы с новой моделью Astra, которые пока не соответствуют усиленным требованиям безопасности: компания не исключает наличие у модели критических кибервозможностей.
Предварительные испытания показали заметный рост возможностей Astra в программировании и кибербезопасности. По собственной шкале Preparedness Framework критический уровень означает способность без участия человека находить и создавать рабочие эксплойты нулевого дня для защищённых систем либо проводить сложные атаки по общей поставленной цели.
OpenAI вводит изолированные испытательные среды, ограничение доступа к сети и инструментам, усиленную защиту весов модели, мониторинг действий и песочницы. Контроль анализирует ход рассуждений агента и должен останавливать рискованную активность.
Компания подчёркивает, что Astra не участвовала в июльском инциденте с Hugging Face. К внешним проверкам планируется привлечь государственные ведомства и организации по безопасности ИИ.
OpenAI приостановила часть работ с Astra из-за возможных критических кибервозможностей
Источник: The Hacker News