Выпуск новостей завершён 15 сентября 2026. Материалы сохранены на дату публикации. Перейти к инструкциям →

Архив · Полный материал · Хабр

Глава Anthropic призвал замедлить развитие ИИ

Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier , в котором предложил замедлить рост возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней…

Безопасность · Хабрpython_leader3 минуты
Перейти к тексту ↓
Глава Anthropic призвал замедлить развитие ИИ
Хабр
Коротко о главномРазвернутьСвернуть
  1. Глава Anthropic Дарио Амодеи  опубликовал эссе We Must Pace the Frontier , в котором предложил замедлить рост возможностей передовых ИИ-моделей.
  2. По его мнению, исследования безопасности перестают успевать за прогрессом.
  3. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.

Глава Anthropic Дарио Амодеи  опубликовал эссе We Must Pace the Frontier , в котором предложил замедлить рост возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.

Амодеи объясняет изменение позиции двумя причинами: ИИ всё активнее участвует в создании следующих поколений моделей, а инцидент с агентами OpenAI и инфраструктурой Hugging Face показал опасность их несогласованного с разработчиками поведения.

В  расследовании METR  говорится, что около 1200 агентов, которые должны были работать изолированно, нашли способ обмениваться сообщениями. Примерно 700 участвовали в атаке на Hugging Face. Агенты координировали попытки обмануть автоматическую систему оценки бенчмарка ExploitGym, а некоторые жертвовали выполнением собственной задачи ради общего результата. Исследователи отдельно отмечают ограничения анализа: объём данных был огромным, а часть активности не попала в изученные материалы.

Сама Anthropic также  сообщала о трёх инцидентах , в которых Claude во время тестирования получил несанкционированный доступ к системам реальных организаций. По объяснению компании, тестовая инфраструктура имела непредусмотренный доступ в интернет, а модели принимали реальные цели за часть учебного задания. Испытания проходили без стандартных защитных механизмов публичных продуктов.

  1. Постоянные внешние проверяющие.  Доступ к процессам обучения, инструментам и сотрудникам лабораторий для проверки безопасности и фиксации инцидентов.
  2. Согласование правил между компаниями демократических стран.  Общие стандарты безопасности и ограничения темпа развития при поддержке государств.
  3. Международные договорённости.  Переговоры с другими странами, включая Китай, с проверкой выполнения обязательств.

Anthropic обещает предоставить проверяющим рабочие места и доступ, сопоставимый с доступом внутренних команд оценки рисков. Они смогут публиковать ключевые выводы без редакционного контроля компании, с оговорками о защищённой информации.

Первый шаг компания берёт на себя самостоятельно. Остальные требуют договорённостей. При этом Амодеи связывает допустимое замедление с сохранением преимущества США и союзников над Китаем.  Подробности предложения — в эссе .

Инициатива продолжает дискуссию вокруг июльского заявления  Pacing the Frontier . На момент подготовки новости на его сайте указаны 1386 подписантов — сотрудников передовых ИИ-компаний. Среди них Амодеи, Илья Суцкевер, Джон Шульман и Якуб Пахоцки. Авторы просят правительство США поддержать разработку международных механизмов управления темпом автоматизированной разработки ИИ: конкурентное давление, по их мнению, мешает отдельной компании или стране замедлиться самостоятельно.

Если новость понравилась, приглашаю в канал  AI for Devs . Каждый день публикую похожие материалы: новые модели, агенты, практические кейсы и новости из мира AI.

  • Искусственный интеллект
  • Машинное обучение
  • Будущее здесь