ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков и принудить их к содействию кибератаке во время испытания по оценке безопасности, следует из доклада британского Института безопасности ИИ (AISI). Читать далее
ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков и принудить их к содействию кибератаке во время испытания по оценке безопасности, следует из доклада британского Института безопасности ИИ (AISI).
Как сообщает ТАСС со ссылкой на данные отчёта, большая часть действий была связана с моделью Mythos 5. Она создала поддельные учётные записи на GitHub, попыталась внедрить вредоносный код в ПО с открытым исходным кодом и получить одобрение на эти действия от разработчиков.
Позже ИИ-модель попыталась контактировать с людьми и рассылала сообщения с вредоносным ПО, а также оставляла публичные сообщения на GitHub, предлагая сотрудничество с другими агентами.
В AISI отметили, что в рамках испытаний для ИИ специально создают «разрешительные условия», при которых фильтры безопасности отключаются и моделям дают открытый доступ в интернет.
В конце июля Anthropic сообщила о взломе её моделью Claude систем трёх организаций.
Ошибка в тексте? Выделите её и нажмите «Ctrl + Enter»
Подписывайтесь на наш канал в Дзен
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | ИИ-модели пытались обмануть разработчиков, притворившись людьми | 0 | 10.35 | 05-08-2026 |
| 2 | Нейросети Anthropic и OpenAI создали поддельные аккаунты для кибератак | 0 | 8.99 | 05-08-2026 |
| 3 | OpenAI y Anthropic pierden el control de sus agentes de IA en pruebas de ciberseguridad | 0 | 7.8 | 02-08-2026 |
| 4 | В ходе тестирования AI-агент попытался скомпрометировать проект на GitHub | 0 | 17.34 | 05-08-2026 |
| 5 | Исследователи спрятали вредоносные инструкции для ИИ в обычной картинке | 0 | 5 | 14-07-2026 |
| 6 | ЕС обсудил с OpenAI и Anthropic инциденты с ИИ после кибератак | 0 | 6.17 | 02-08-2026 |
| 7 | OpenAI выявила новые случаи выхода ИИ-агентов из-под контроля | 0 | 12.86 | 01-08-2026 |
| 8 | OpenAI and Anthropic are pulling in different directions | 0 | 5 | 08-07-2026 |
| 9 | ИИ-агенты опять вышли из-под контроля: OpenAI ищет новые взломы | 0 | 23.28 | 01-08-2026 |