Claude Opus 5.5: умеренное ускорение ИИ-разработок, но не полная автоматизация
Claude Opus 5.5 демонстрирует умеренное ускорение ИИ-разработок
Исследователи METR провели предварительную оценку Claude Opus 5.5, сосредоточившись на его влиянии на исследования и разработки (R&D) в области искусственного интеллекта. Оценка базировалась на тестировании возможностей модели через API в течение 10 рабочих дней. Использовались пять задач: Budget NanoGPT Speedrun, Language Model Conceptual Argumentation (LMCA), Train a Program, Gaming Bot и Sunlight. Результаты сопоставлялись с данными о предыдущих моделях и информацией от Anthropic.
Claude Opus 5.5 не автоматизирует полностью ИИ-разработки
Claude Opus 5.5 представляет собой умеренное улучшение по сравнению с предыдущей моделью Fable 5.1. Модель демонстрирует прогресс как в верифицируемых задачах, таких как Budget NanoGPT и Gaming Bot, так и в менее проверяемых, например LMCA и Sunlight. Однако Claude Opus 5.5 сохраняет качественные недостатки, которые вряд ли проявились бы у человека-эксперта при решении сложных долгосрочных задач или открытом рассуждении. Полная автоматизация ИИ-разработок потребует значительного улучшения предвидения, прогнозирования, создания собственных циклов обратной связи и других навыков, которые можно отнести к «суждению» или «вкусу» исследователя. Claude Opus 5.5 не показывает существенного прогресса в этих областях. Тем не менее, модель способна заметно ускорить работу исследователей и автоматизировать отдельные аспекты R&D, повышая продуктивность.
Разработка Claude Opus 5.5 получила ускорение благодаря ИИ
Разработка Claude Opus 5.5 была частично ускорена с помощью искусственного интеллекта, но не достигла уровня драматического ускорения. Предварительный отчет об ускорении ИИ-разработок в Anthropic оценивает это ускорение примерно в 1,5 раза (1,5 года разработки за 1 год), с 30% вероятностью достижения 2-кратного ускорения. Оценка основана на внутренних тестах возможностей модели, которые показали инкрементальное улучшение по сравнению с Fable 5.1. Информация от Anthropic также подтверждает продолжение тренда AECI (Anthropic’s Estimated Capability Index) с момента Mythos Preview. Оценка проводилась в рамках соглашения, включающего положения о прозрачности, позволяющие раскрывать определенные факты без согласия Anthropic.
Источник: METR