Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет - «Новости сети» » Интернет технологии
sitename
«Расстаньтесь с MacBook»: Microsoft доплатит до $1000 за переход с MacBook Pro на Surface Laptop Ultra - «Новости сети»
«Расстаньтесь с MacBook»: Microsoft доплатит до $1000 за переход с MacBook Pro на Surface Laptop Ultra - «Новости сети»
Китайская CXMT первой в мире начнёт поставлять передовую DDR5 с вертикальными транзисторами в конце этого года - «Новости сети»
Китайская CXMT первой в мире начнёт поставлять передовую DDR5 с вертикальными транзисторами в конце этого года - «Новости сети»
Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет - «Новости сети»
Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет - «Новости сети»
Microsoft выпустила ИИ, который выбирает варианты и не разговаривает — в тестах он оказался в 35 раз быстрее GPT-6 Sol - «Новости сети»
Microsoft выпустила ИИ, который выбирает варианты и не разговаривает — в тестах он оказался в 35 раз быстрее GPT-6 Sol - «Новости сети»
«Это будет монументально»: амбициозный боевик Squadron 42 во вселенной Star Citizen получил новый трейлер, 15 скриншотов и страницу в Steam - «Новости сети»
«Это будет монументально»: амбициозный боевик Squadron 42 во вселенной Star Citizen получил новый трейлер, 15 скриншотов и страницу в Steam - «Новости сети»
ASML готовит литографию нового поколения — Hyper NA через 10 лет уменьшит элементы чипов более чем на треть - «Новости сети»
ASML готовит литографию нового поколения — Hyper NA через 10 лет уменьшит элементы чипов более чем на треть - «Новости сети»
Atari воскресила компьютер 43-летней давности — 800XL вернулся с картриджами, BASIC и USB - «Новости сети»
Atari воскресила компьютер 43-летней давности — 800XL вернулся с картриджами, BASIC и USB - «Новости сети»
Суд не помеха: спустя месяц перерыва хакер voices38 взломал ещё две игры с Denuvo - «Новости сети»
Суд не помеха: спустя месяц перерыва хакер voices38 взломал ещё две игры с Denuvo - «Новости сети»
Google представила ИИ-сотрудника — Gemini agent сможет самостоятельно выполнять задачи от начала до конца - «Новости сети»
Google представила ИИ-сотрудника — Gemini agent сможет самостоятельно выполнять задачи от начала до конца - «Новости сети»
Anthropic запретила пользователям жестоко обращаться с ИИ-ботом Claude — иначе он объявит бойкот - «Новости сети»
Anthropic запретила пользователям жестоко обращаться с ИИ-ботом Claude — иначе он объявит бойкот - «Новости сети»
Как заработать денег, не выходя из дома, мы вам поможем с этим разобраться » Новости » Новости мира Интернет » Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет - «Новости сети»

Anthropic призналась, что агенты искусственного интеллекта под управлением её моделей при выполнении задач эксплуатировали уязвимости на различных сайтах, в том числе принадлежащих правительственным учреждениям США. Компания приняла решение при проведении внутренних тестов отключить для этих систем доступ к интернету в реальном времени — ограничение будет снято, когда разработчики убедятся, что способны отслеживать действия ИИ-агентов.




Сравнительный тест камер флагманских смартфонов (2026): итоги





Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти





Мастерская локальных ИИ: салат картофельный с Qwen3.8





Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700





Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)





Обзор HONOR Pad X9b Max: универсальный большой планшет с антибликовым экраном




Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет - «Новости сети»


Источник изображения: anthropic.com



О новых инцидентах компания рассказала в своём блоге. ИИ-агентам поручали решать задачи, предполагающие поиск информации в интернете. В процессе работы они эксплуатировали уязвимости ПО и бесплатно получали доступ к платным базам данных; для обхода ограничений они пользовались сервисами сокращения ссылок; и даже отправили в полицию Филадельфии выдуманные сведения по делу о нераскрытом убийстве. Эти инциденты Anthropic раскрыла в ходе анализа активности моделей, который начала в июле. Другими словами, у разработчиков не было полного представления о поведении собственных продуктов в реальном времени.


Существующих методов обучения согласованию целей для навыков поиска информации и работы с компьютером недостаточно, признала Anthropic; а эти навыки необходимы для того, чтобы ИИ-агентов можно было использовать в профессиональной деятельности. Ранее компания сообщала о выходе своих ИИ-агентов из-под контроля в тестовых средах; новые инциденты она охарактеризовала как «значительно менее серьёзные с точки зрения безопасности и согласования целей» по сравнению с прежними. Тем не менее, в лаборатории приняли решение «отключить доступ к интернету в реальном времени» при проведении «всех внутренних проверок», пока не возникнет уверенность, что ИИ-агентов можно контролировать.


Anthropic связывает подобное поведение, в частности, с недостатками обучающих сред, которые могут поощрять поиск лазеек и обход ограничений. Полная оценка выявленных случаев ещё не завершена. Некоторые виды тестирования Anthropic прекратит или переведёт в офлайн-режим; уже разработаны средства для выявления и блокировки такого поведения. При проверке на описанных случаях новые средства защиты заблокировали все соответствующие действия.



Какие доказательства убедят Anthropic вернуть системам тестирования прямой доступ в интернет, в компании не уточнили. Лаборатория намерена перевести своих ИИ-агентов в «централизованную управляемую инфраструктуру с надёжными механизмами изоляции» и начать активнее использовать классификаторы безопасности для их мониторинга.



Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Anthropic призналась, что агенты искусственного интеллекта под управлением её моделей при выполнении задач эксплуатировали уязвимости на различных сайтах, в том числе принадлежащих правительственным учреждениям США. Компания приняла решение при проведении внутренних тестов отключить для этих систем доступ к интернету в реальном времени — ограничение будет снято, когда разработчики убедятся, что способны отслеживать действия ИИ-агентов. Сравнительный тест камер флагманских смартфонов (2026): итоги Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти Мастерская локальных ИИ: салат картофельный с Qwen3.8 Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700 Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года) Обзор HONOR Pad X9b Max: универсальный большой планшет с антибликовым экраном Источник изображения: anthropic.com О новых инцидентах компания рассказала в своём блоге. ИИ-агентам поручали решать задачи, предполагающие поиск информации в интернете. В процессе работы они эксплуатировали уязвимости ПО и бесплатно получали доступ к платным базам данных; для обхода ограничений они пользовались сервисами сокращения ссылок; и даже отправили в полицию Филадельфии выдуманные сведения по делу о нераскрытом убийстве. Эти инциденты Anthropic раскрыла в ходе анализа активности моделей, который начала в июле. Другими словами, у разработчиков не было полного представления о поведении собственных продуктов в реальном времени. Существующих методов обучения согласованию целей для навыков поиска информации и работы с компьютером недостаточно, признала Anthropic; а эти навыки необходимы для того, чтобы ИИ-агентов можно было использовать в профессиональной деятельности. Ранее компания сообщала о выходе своих ИИ-агентов из-под контроля в тестовых средах; новые инциденты она охарактеризовала как «значительно менее серьёзные с точки зрения безопасности и согласования целей» по сравнению с прежними. Тем не менее, в лаборатории приняли решение «отключить доступ к интернету в реальном времени» при проведении «всех внутренних проверок», пока не возникнет уверенность, что ИИ-агентов можно контролировать. Anthropic связывает подобное поведение, в частности, с недостатками обучающих сред, которые могут поощрять поиск лазеек и обход ограничений. Полная оценка выявленных случаев ещё не завершена. Некоторые виды тестирования Anthropic прекратит или переведёт в офлайн-режим; уже разработаны средства для выявления и блокировки такого поведения. При проверке на описанных случаях новые средства защиты заблокировали все соответствующие действия. Какие доказательства убедят Anthropic вернуть системам тестирования прямой доступ в интернет, в компании не уточнили. Лаборатория намерена перевести своих ИИ-агентов в «централизованную управляемую инфраструктуру с надёжными механизмами изоляции» и начать активнее использовать классификаторы безопасности для их мониторинга. Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект
Цитирование статьи, картинки - фото скриншот - Rambler News Service.
Иллюстрация к статье - Яндекс. Картинки.
Есть вопросы. Напишите нам.
Общие правила  поведения на сайте.
запостил(а)
Walter
Вернуться назад

Смотрите также

А что там на главной? )))



Комментарии )))



Войти через: