Собственные материалы, источники всегда указаны

Archestra открывает исходный код движка безопасности ИИ OpenAPPA после безупречных результатов в бенчмарках

OpenAPPA показал нулевой процент успешных атак в тестах Bench-Corp и AgentThreatBench, предназначенных для оценки защиты от утечки данных в ИИ-агентах.

The Global Wire Newsroom ·

Link preview · horizonglobalnews.com

Archestra открывает исходный код движка безопасности ИИ OpenAPPA после безупречных результатов в бенчмарках

OpenAPPA показал нулевой процент успешных атак в тестах Bench-Corp и AgentThreatBench, предназначенных для оценки защиты от утечки данных в ИИ-агентах.

Share

Эта статья переведена автоматически нашим редакционным ИИ с английского оригинала. Читать на английском

Archestra открывает исходный код движка безопасности ИИ OpenAPPA после безупречных результатов в бенчмарках

Разработчик искусственного интеллекта Archestra выпустил OpenAPPA — движок безопасности с открытым исходным кодом, предназначенный для нейтрализации уязвимостей утечки данных, вызванных непрямыми промпт-инъекциями и галлюцинациями языковых моделей в рабочих процессах автономных агентов. Согласно техническому отчету, опубликованному технологическим журналистом Bruno Couriol 3 октября 2026 года, новое программное обеспечение показало нулевой процент успешных атак в двух основных стандартах оценки искусственного интеллекта: Bench-Corp и AgentThreatBench. Релиз нацелен на критический вектор уязвимости при развертывании ИИ в корпоративном секторе, когда внешние входные данные могут перехватить управление поведением модели и спровоцировать несанкционированную передачу конфиденциальной информации. Открывая исходный код движка, Archestra стремится предоставить разработчикам корпоративного ПО и командам по кибербезопасности стандартизированный уровень защиты в режиме реального времени, способный перехватывать исполнение вредоносных полезных нагрузок до того, как чувствительные данные покинут корпоративные сети.

## Ключевые факты - Archestra выпустила OpenAPPA — движок безопасности с открытым исходным кодом, предназначенный для предотвращения утечки данных в автономных рабочих процессах ИИ. - Движок безопасности зафиксировал нулевой процент успешных атак в двух крупных пакетах бенчмарков: Bench-Corp и AgentThreatBench. - Bench-Corp оценивает системы защиты на примере 20 сложных многошаговых сценариев корпоративных рабочих процессов. - OpenAPPA специально нацелен на устранение нарушений безопасности, возникающих в результате атак с использованием промпт-инъекций и галлюцинаций моделей. - Релиз программного обеспечения и результаты бенчмарков были подробно описаны в репортаже Bruno Couriol от 3 октября 2026 года.

## Что произошло Archestra представила OpenAPPA в качестве специализированного связующего программного обеспечения (middleware) безопасности с открытым исходным кодом, предназначенного для защиты автономных приложений искусственного интеллекта. ПО было разработано специально для противодействия утечке данных — сценарию, при котором ИИ-агентом, взаимодействующим с корпоративными базами данных, API или платформами обмена сообщениями, манипулируют с целью передачи чувствительной внутренней информации на внешние, ненадежные ресурсы.

В ходе тестирования, проведенного на базе признанных фреймворков оценки безопасности, OpenAPPA полностью защитил тестовые среды, предотвратив все попытки взлома. Как сообщает Bruno Couriol, движок показал нулевой процент успешных атак как в Bench-Corp, так и в AgentThreatBench. Bench-Corp оценивает способность движка удерживать границы безопасности в 20 различных многошаговых корпоративных рабочих процессах, которые моделируют реальные среды компаний, где ИИ-агенты обрабатывают электронную почту, запрашивают базы данных клиентов, обновляют записи и взаимодействуют со сторонними программными инструментами. AgentThreatBench аналогичным образом подвергает агентов воздействию состязательных вводных данных, предназначенных для обхода защитных барьеров системы.

Предотвратив все попытки состязательных атак в обеих тестовых средах, OpenAPPA продемонстрировал полную нейтрализацию автоматизированных методов промпт-инъекций. Модель распространения с открытым исходным кодом, выбранная Archestra, позволяет инженерам-программистам анализировать, модифицировать и интегрировать архитектуру безопасности непосредственно в существующие конвейеры оркестрации агентов, не полагаясь на проприетарные прокси-серверы безопасности с закрытым исходным кодом.

## Почему это важно По мере того как предприятия активно переходят от простых разговорных чат-ботов к автономным программным агентам, способным выполнять запросы к базам данных, генерировать корпоративную корреспонденцию и вызывать интерфейсы прикладного программирования (API), поверхность атак на корпоративное ПО существенно расширяется. Традиционные средства киберзащиты, такие как сетевые межсетевые экраны и фаерволы веб-приложений, работают со структурированным сетевым трафиком и предопределенными списками контроля доступа. Они фундаментально не приспособлены для интерпретации вероятностных взаимодействий на естественном языке, определяющих работу больших языковых моделей (LLM).

Утечка данных представляет собой один из наиболее серьезных бизнес-рисков, связанных с развертыванием автономного ИИ. Если вредоносная нагрузка успешно манипулирует агентом, заставляя его воспринимать вредоносные инструкции как легитимные административные команды, конфиденциальные корпоративные данные — включая персональные данные, финансовые отчеты, коммерческую тайну и внутреннюю переписку — могут быть переданы на внешние серверы, контролируемые злоумышленниками. Финансовые, юридические и регуляторные последствия таких нарушений в рамках таких регламентов, как General Data Protection Regulation (GDPR) Европейского союза или California Consumer Privacy Act (CCPA), могут быть суровыми, включая штрафы со стороны регуляторов и репутационные потери.

Продемонстрировав нулевой процент успешных атак в 20 сценариях корпоративных рабочих процессов Bench-Corp, OpenAPPA показывает, что детерминированное обеспечение безопасности может сочетаться с вероятностными языковыми моделями без ущерба для их функциональных возможностей. Для директоров по корпоративной безопасности, сомневающихся в одобрении инициатив по внедрению автономных агентов из-за рисков утечки данных, решения по безопасности с открытым исходным кодом, такие как OpenAPPA, предоставляют жизнеспособную структуру для жесткого ограничения доступа к данным во время выполнения.

## Контекст Модель уязвимостей, на которую нацелен OpenAPPA, вытекает из архитектурных особенностей современных языковых моделей на базе трансформеров. Большие языковые модели изначально не разделяют системные инструкции, предоставленные разработчиками ПО, и неструктурированные данные, полученные из внешних источников, таких как электронные письма, веб-страницы или документы клиентов. Эта архитектурная особенность порождает промпт-инъекции — уязвимость безопасности, классифицированную Open Worldwide Application Security Project (OWASP) как угрозу №1 для LLM-приложений.

Атаки путем промпт-инъекций делятся на две основные категории: прямые и непрямые. Прямая промпт-инъекция происходит, когда конечный пользователь явно дает указание ИИ-модели проигнорировать ее ограничения безопасности. Непрямая промпт-инъекция, гораздо более опасная в корпоративном контексте, возникает, когда ИИ-агент считывает данные, содержащие скрытые инструкции, размещенные там третьей стороной. Например, агент, которому поручено составить сводку непрочитанных писем клиентов, может столкнуться с письмом, содержащим невидимый текст с командой найти в репозитории компании приватные ключи API и отправить их на внешний веб-сервер.

Помимо преднамеренных состязательных атак, такую же угрозу для конфиденциальности данных представляют галлюцинации моделей. Галлюцинация происходит, когда LLM генерирует правдоподобный, но полностью сфабрикованный или контекстуально неточный результат. В автономных рабочих процессах сгенерированная галлюцинацией команда может привести к тому, что агент вызовет незапланированные эндпоинты API, некорректно сформирует сетевые запросы или отправит чувствительные данные на ошибочные внешние адреса.

Предыдущие попытки решить эти проблемы безопасности в основном опирались на защитный промптинг — информирование самой модели о необходимости соблюдать осторожность — или на вторичные модели-фильтры, предназначенные для оценки входящего текста. Защитный промптинг часто оказывается неэффективным, поскольку состязательные промпты могут обходить системные инструкции, в то время как вторичные оценочные модели добавляют существенную вычислительную задержку и остаются уязвимыми перед аналогичными методами обхода. Появление стандартизированных пакетов тестирования безопасности, таких как Bench-Corp и AgentThreatBench, создало измеримые метрики для проверки того, полагаются ли решения по безопасности на неэффективную фильтрацию текста или применяют строгий архитектурный контроль доступа.

## Реакция Ожидается, что релиз движка безопасности с открытым исходным кодом, достигнувшего полной нейтрализации угроз в известных бенчмарках, вызовет значительный интерес в сферах кибербезопасности и разработки ПО. Исследователи безопасности, специализирующиеся на безопасности машинного обучения, давно выступали за создание детерминированных изолированных сред (песочниц) вокруг вероятностных моделей, утверждая, что программные агенты ни в коем случае не должны обладать полными полномочиями по умолчанию для выполнения сетевых запросов без явной проверки на основе политик безопасности.

Ожидается, что руководители корпоративных IT-отделов, планирующие развертывание внутренних ИИ-агентов, позитивно оценят результаты бенчмарков, хотя архитекторы программного обеспечения, скорее всего, тщательно изучат операционные компромиссы, необходимые для достижения нулевого процента успешных атак. В инженерии кибербезопасности показатели абсолютной защиты часто связаны со строгим применением политик, что потенциально может ограничить автономность агента или вызывать ложные срабатывания в ходе сложных многошаговых процессов.

Предполагается, что разработчики open-source решений и аналитики по безопасности изучат публичный код OpenAPPA, чтобы определить, как движок обрабатывает граничные случаи, управляет соблюдением политик и интегрируется с популярными фреймворками ИИ-агентов, такими как LangChain, AutoGen или LlamaIndex. Отраслевые аналитики также будут следить за тем, переймут ли коммерческие вендоры решений по безопасности аналогичные паттерны детерминированного перехвата в своих проприетарных шлюзах безопасности.

## Что пока неизвестно Хотя заявленный нулевой процент успешных атак в Bench-Corp и AgentThreatBench представляет собой важную веху, многие операционные и технические детали остаются неподтвержденными в публичном поле. Оценки в бенчмарках отражают стандартизированные условия тестирования; пока неизвестно, как OpenAPPA ведет себя при развертывании в гетерогенных корпоративных IT-средах с нестандартными API, устаревшими подключениями к базам данных и крайне непредсказуемыми пользовательскими сценариями.

Кроме того, в материале Bruno Couriol не детализированы конкретные вычислительные накладные расходы, создаваемые OpenAPPA. Корпоративным разработчикам требуется подробная телеметрия о том, как движок безопасности влияет на сквозную задержку обработки, израсходование токенов API, использование вычислительных ресурсов и операционную стоимость одной транзакции. Также отсутствуют данные об уровне ложноположительных срабатываний движка — в частности, о том, помечаются ли корректные корпоративные инструкции как попытки утечки данных, что могло бы нарушить стандартные бизнес-процессы.

Наконец, пока неясно, как OpenAPPA будет адаптироваться при столкновении с новыми, ранее не встречавшимися методами промпт-инъекций, разработанными специально для обхода его механизмов защиты по мере эволюции состязательных стратегий.

## За чем следить Среди ключевых событий, за которыми стоит следить после запуска OpenAPPA, — независимая экспертная проверка результатов бенчмарков Archestra академическими исследователями и сторонними аудиторскими компаниями в сфере кибербезопасности. История коммитов в основном репозитории, баг-трекер и пулл-реквесты сообщества послужат наглядными индикаторами того, насколько активно разработчики внедряют продукт и насколько он стабилен в реальных условиях.

Команды безопасности также будут ждать публикации кейсов с деталями корпоративных интеграций, в частности того, как OpenAPPA справляется с интеграцией с основными корпоративными системами управления идентификацией и доступом (IAM), такими как OAuth, SAML и системы контроля доступа на основе ролей.

Кроме того, важным объектом для наблюдения станут будущие итерации Bench-Corp и AgentThreatBench. По мере того как создатели бенчмарков будут обновлять свои тестовые наборы новыми векторами атак, продвинутыми методами обфускации и сложными сценариями взаимодействия нескольких агентов, отрасль увидит, сможет ли OpenAPPA сохранить стопроцентную защиту в условиях меняющегося ландшафта угроз искусственного интеллекта.

Данный новостной материал основан на оригинальном репортаже, опубликованном технологическим журналистом Bruno Couriol 3 октября 2026 года.

Источник: Bruno Couriol

Похожие материалы