Компания Anthropic, разработчик систем искусственного интеллекта, представила новую флагманскую модель — Claude Opus 5.5. Релиз состоялся менее чем через две недели после того, как генеральный директор компании Дарио Амодей (Dario Amodei) публично призвал замедлить темпы выпуска новых моделей ИИ, выразив обеспокоенность участившимися инцидентами безопасности в отрасли, включая случаи в собственной компании, где один из исследователей уволился, опасаясь, что технология может привести к исчезновению человечества в ближайшие годы.

Как сообщает Anthropic, новая модель прошла «исчерпывающие тесты на согласованность (alignment), предрелизную оценку со стороны сторонних организаций и проверки безопасности в таких областях высокого риска, как кибербезопасность и биология». По заявлению компании, Claude Opus 5.5 показал положительные результаты в тестах на предвзятость рассуждений и попытки вырваться из изолированной среды. В Anthropic назвали его «самой производительной моделью из всех, что мы тестировали на сегодняшний день, с заметными улучшениями по ряду параметров, связанных с недавними инцидентами в сфере кибербезопасности».

Ключевой механизм безопасности модели заключается в перенаправлении подозрительных запросов на более проверенные, старые версии. Если система безопасности срабатывает, запрос прозрачно переадресуется другой модели: большинство задач в области кибербезопасности — на Opus 4.8, а задачи, связанные с биологией и разработкой больших языковых моделей, — на Opus 5.

Компания также ужесточает критерии фильтрации сред, используемых в обучении с подкреплением, поскольку, по её словам, «неисправные среды являются важным источником несогласованного поведения». Anthropic совершенствует «вознаграждения за согласованность», создаёт автоматизированные методы генерации новых сценариев для тренировки безопасности и усиливает общий контроль.

В Anthropic подчеркнули, что «для более capable-моделей должна быть установлена более высокая планка безопасности» и что «по мере того, как ИИ становится всё более мощным, государственная политика должна играть более важную роль в обеспечении безопасности этих систем». Для реализации усиленных мер компания заключила соглашение с консалтинговой фирмой Accenture о создании необходимой инфраструктуры.

Claude Opus 5.5 ориентирован на сложные задачи корпоративных клиентов в таких секторах, как финансовые услуги, юриспруденция и разработка программного обеспечения. При этом стоимость использования модели примерно на 40% ниже, чем у Claude Opus 5. По отзывам первых тестировщиков, модель общается более естественно, а её формулировки стали яснее и удобнее для восприятия в ходе длительных рабочих сессий.