Собственные материалы, источники всегда указаны

OpenAI приостанавливает тестирование модели ИИ Astra из-за критических опасений в сфере кибербезопасности

Компания в сфере искусственного интеллекта OpenAI приостановила тестирование своей модели Astra из-за опасений, что система может достичь критического порога риска и стать способной к проведению автономных кибератак.

The Global Wire Newsroom ·

Link preview · horizonglobalnews.com

OpenAI приостанавливает тестирование модели ИИ Astra из-за критических опасений в сфере кибербезопасности

Компания в сфере искусственного интеллекта OpenAI приостановила тестирование своей модели Astra из-за опасений, что система может достичь критического порога риска и стать способной к проведению автономных кибератак.

Share

Эта статья переведена автоматически нашим редакционным ИИ с английского оригинала. Читать на английском

OpenAI приостанавливает тестирование модели ИИ Astra из-за критических опасений в сфере кибербезопасности

Организация в области искусственного интеллекта OpenAI приостановила тестирование новой модели под названием Astra после проведения внутренних оценок, которые не смогли исключить наличие у системы серьезных рисков в сфере кибербезопасности, согласно сообщению Taylor Herzlich. Это решение означает значительную паузу в процессе развертывания продуктов компании, пока группы по безопасности выясняют, пересекает ли модель предопределенную границу безопасности, которая отнесла бы ее к категории серьезной угрозы для цифровой инфраструктуры.

## Halting Development Over Security Risks

Решение о приостановке тестирования было принято после того, как внутренние оценки безопасности вызвали опасения относительно возможностей программного обеспечения, согласно сообщению Taylor Herzlich. Компания из San Francisco, возглавляемая генеральным директором Sam Altman, ввела временный запрет на тестирование модели Astra после того, как эксперты пришли к выводу, что не могут с уверенностью исключить достижение системой «критического» уровня риска в соответствии с руководящими принципами организации по управлению рисками.

В рамках внутренних структур управления рисками OpenAI разрабатываемые модели регулярно оцениваются по нескольким направлениям, включая кибербезопасность, биологические угрозы, способности к убеждению и автономное самовоспроизведение. Когда модель приближается к определенным порогам в этих категориях или превышает их, протоколы безопасности требуют немедленного прекращения публичного развертывания и тестирования до тех пор, пока не будут разработаны дополнительные защитные меры или надежно реализованы механизмы снижения рисков.

Пауза в работе над Astra подчеркивает постоянные проблемы, с которыми сталкиваются ведущие разработчики искусственного интеллекта, поскольку передовые модели демонстрируют все более изощренные способности к рассуждению и решению технических задач. Хотя эти достижения дают значительные преимущества для разработки программного обеспечения и автоматизации, они также создают беспрецедентные проблемы в области безопасности, если лежащая в их основе технология может быть использована для выполнения вредоносного ПО или эксплуатации инфраструктуры.

## The Definition of Critical Risk

В контексте структуры рисков OpenAI обозначение «Критический» представляет собой наивысший уровень обеспокоенности относительно потенциального вреда. Согласно сообщению Taylor Herzlich, достижение этого порога означает, что модель Astra обладает возможностями, которые могут позволить ей эксплуатировать реальные компьютерные системы или проводить кибератаки без необходимости руководства или вмешательства со стороны человека.

Автономные кибероперации давно признаны экспертами по компьютерной безопасности и лицами, принимающими решения, одной из самых опасных возможностей, которыми может обладать система искусственного интеллекта. В отличие от традиционных автоматизированных скриптов или вредоносных программ, передовая генеративная модель, способная к автономному техническому исполнению, могла бы динамически адаптироваться к защитным мерам, выявлять ранее неизвестные уязвимости — так называемые уязвимости нулевого дня (zero-day exploits) — и перемещаться по сложным компьютерным сетям совершенно самостоятельно.

Невозможность исключить подобные возможности во время тестирования указывает на то, что в ходе бенчмаркинга Astra продемонстрировала поведение или показатели производительности, весьма напоминающие методы автономной эксплуатации уязвимостей. Хотя компания публично не раскрывала конкретные технические журналы или детали демонстрации, политика управления рисками требует принятия превентивных мер даже в тех случаях, когда серьезный риск лишь подозревается, а не полностью подтвержден.

## Autonomous Capabilities and Threat Vectors

Разработка передовых моделей искусственного интеллекта все в большей степени ориентирована на агентные (agentic) возможности, при которых программные системы проектируются для планирования, рассуждения и выполнения многоэтапных задач в сложных цифровых средах. Хотя агентные модели предназначены для помощи пользователям в исследованиях, написании кода и автоматизации рабочих процессов, двойное назначение этой технологии означает, что те же самые возможности могут быть использованы как в защитных, так и в наступательных целях кибербезопасности.

Когда система искусственного интеллекта получает возможность напрямую взаимодействовать с внешними программными инструментами, динамически записывая и выполняя код, потенциальная поверхность атаки значительно расширяется. В защитных сценариях такие инструменты могут помогать сетевым администраторам находить ошибки в коде и устранять уязвимости программного обеспечения до того, как ими смогут воспользоваться злоумышленники. И наоборот, если модель искусственного интеллекта обретет автономные наступательные возможности, она потенциально сможет сканировать подключенные сети на предмет брешей в безопасности, создавать пользовательский код эксплойтов и развертывать вредоносную полезную нагрузку в корпоративных системах без внешнего контроля.

Приостановка работы над Astra подчеркивает техническую сложность создания эффективных защитных барьеров для моделей с высоким уровнем технической подготовки. Обеспечение безопасности передовых программных агентов требует гарантировать, что модель не сможет обходить системные промпты, нарушать встроенные инструкции по соблюдению безопасности или находить новые способы выполнения несанкционированных команд в хост-сетях.

## Frameworks for AI Preparedness and Evaluation

Крупнейшие компании в области искусственного интеллекта, включая OpenAI, разработали формальные структуры безопасности и готовности (preparedness frameworks), предназначенные для мониторинга и оценки возникающих рисков, связанных с передовыми моделями. Эти структуры устанавливают четкие границы управления, определяя конкретные операционные рамки и пороги, которые регламентируют, когда модель может переходить к следующим этапам обучения, внутреннего редтиминга, внешнего бета-тестирования или коммерческого развертывания.

Оценка моделей на предмет риска кибербезопасности обычно включает в себя масштабный редтиминг (red-teaming) — процесс, при котором внутренние исследователи безопасности и внешние партнеры по тестированию намеренно пытаются побудить модель к выполнению вредоносных задач. Оценщики проверяют, будет ли система помогать в создании вредоносного ПО, содействовать в обратной разработке защищенных программных систем или автономно взаимодействовать с симулируемыми сетевыми средами для получения несанкционированного доступа.

Если модель демонстрирует высокий уровень успеха при выполнении сложных многоэтапных кибератак во время редтиминга, структуры управления рисками требуют от разработчиков приостановить тестирование и ввести структурные меры безопасности. Эти меры могут включать изменение обучающего набора данных, переобучение слоев выравнивания (alignment layers), внедрение строгих механизмов фильтрации на системном уровне или переработку архитектуры для ограничения доступа программы к средам исполнения.

## Regulatory and Sector-Wide Implications

Приостановка тестирования Astra происходит на фоне повышенного внимания со стороны регулирующих органов, чиновников по национальной безопасности и разработчиков технологической политики по всему миру к безопасности передовых систем искусственного интеллекта. Правительства в Северной Америке, Европе и Азии уделяют все больше внимания последствиям использования передовых моделей машинного обучения для кибербезопасности, призывая к стандартизированным оценкам безопасности, сторонним аудитам и обязательным протоколам отчетности о рисках.

Опасения относительно киберопераций с использованием ИИ привели к политическим инициативам, направленным на установление базовых требований безопасности для разработчиков базовых моделей. Законодательные предложения и указы исполнительной власти в нескольких юрисдикциях подчеркивают необходимость поддержания разработчиками надежных систем мониторинга рисков и уведомления соответствующих органов или заинтересованных общественников при приближении к критическим порогам уязвимости.

В технологическом секторе в целом наблюдаются аналогичные проблемы по мере того, как разработчики расширяют возможности передовых моделей. По мере того как модели становятся все более компетентными в написании программного обеспечения и исполнении кода, граница между общей помощью и автономным созданием угроз становится все более размытой. В результате отраслевые стандарты безопасности ИИ продолжают развиваться, а компании внедряют строгие подходы, основанные на протоколах, для управления потенциальными рисками до коммерческих релизов.

## What Lies Ahead

Приостановка компанией OpenAI работы над моделью Astra отражает практическое применение ее структуры управления рисками, при котором внутренние оценки безопасности ставятся выше графиков развертывания. Согласно сообщению Taylor Herzlich, компания будет удерживать тестирование на паузе, пока исследователи безопасности продолжат анализировать поведенческие паттерны модели и оценивать ее профиль риска на предмет соответствия критическим порогам.

Для устранения выявленных проблем разработчики и команды по выравниванию (alignment), как ожидается, проведут дополнительные диагностические тесты, чтобы изолировать конкретные паттерны поведения, которые вызвали классификацию критического риска. В зависимости от результатов модель может подвергнуться существенным изменениям защитных барьеров или базовых параметров обучения перед тем, как будет разрешено возобновить дальнейшее тестирование или оценку.

По мере того как модели искусственного интеллекта продолжают совершенствоваться в рассуждении и автономных возможностях, инциденты, связанные с границами порогов риска, служат важными примерами для механизмов саморегулирования отрасли и структур управления рисками. Будущее развитие ситуации вокруг Astra, вероятно, будет зависеть от того, смогут ли технические модификации успешно снизить риски автономного использования уязвимостей, сохранив при этом запланированную функциональную полезность модели.

Первоначально об этом сообщил Taylor Herzlich.

Источник: Taylor Herzlich

Похожие материалы