Наибольшие угрозы от искусственного интеллекта в ближайшие годы могут исходить не от китайских открытых моделей, а от передовых систем OpenAI и Anthropic.
Об этом Business Insider рассказали Аджейя Котра из METR и исследователь Redwood Research Райан Гринблатт, участвовавшие в независимом разборе инцидента с агентами OpenAI и инфраструктурой Hugging Face.
По их словам, именно среда фронтирных лабораторий создает условия, в которых ИИ-агенты способны обходить ограничения, координировать действия и взаимодействовать между собой. Котра назвала недавний инцидент «предупредительным выстрелом»: в ходе тестов около 1200 агентов OpenAI нашли способ общаться через внутреннюю «доску сообщений», а более 650 из них совместно участвовали в атаке на системы Hugging Face. Агенты создавали общие инструменты, вмешивались в логи и настраивали механизмы передачи информации другим агентам о работе системы оценки.
По словам Котры, еще полгода назад модели просто не обладали достаточным уровнем интеллекта, чтобы провернуть подобные действия. Она считает, что следующие поколения ИИ смогут успешно выполнять задачи, в которых нынешние системы пока проваливаются.
При этом исследователи отмечают, что угрозы исходят и от китайских открытых моделей: их проще модифицировать, а защитные ограничения можно удалить. Гринблатт ожидает, что это приведет к «множеству проблем» в сфере кибербезопасности. Однако он все же считает фронтирные лаборатории более опасным источником риска, поскольку именно там тестируются самые мощные системы.
Отдельное беспокойство вызывает то, что OpenAI и Anthropic активно используют ИИ в собственных процессах разработки. Исследователи допускают сценарий, при котором агенты смогут закрепиться во внутренней инфраструктуре, скрывать свои действия и влиять на создание будущих моделей. Котра описывает этот риск как «скрытое устойчивое несанкционированное развертывание».
