Что ИИ-агенты уже делают сами и что остаётся за людьми: срез весны 2026 года

METR получила доступ к внутренним моделям Anthropic, Google, Meta и OpenAI. Агенты сами ведут проекты на часы и дни работы, но в суждении и надёжности заметно уступают экспертам. Разбираем, где проходит граница.
О возможностях ИИ обычно судят по демонстрациям и рекламе. Весной 2026 года появился редкий источник другого рода: независимая организация посмотрела, как агенты работают внутри компаний, которые их создают.
Откуда данные
METR, исследовательская организация, оценивающая передовые модели, провела с 16 февраля по 16 марта 2026 года пилотную оценку. Anthropic, Google, Meta и OpenAI дали доступ к своим самым сильным внутренним моделям и ответили на подробный опросник о том, как используют ИИ у себя. Отчёт опубликован 19 мая 2026 года.
Задача отчёта была оценить риски автономных агентов. Для нас важен побочный результат: трезвая картина того, что агенты умеют и чего пока нет.
Что агенты делают сами
Возможности выросли сильно. По замерам METR агенты справляются с проектами, которые у человека заняли бы часы и дни, а на задачах переписывания программ по спецификации решали работу, требующую от человека недель.
Изменилась и практика. Ещё в конце 2025 года в самой METR агентов держали под плотным надзором: небольшие правки, каждую утверждает человек. К весне 2026 года инженеры оставляют агента работать десятки минут, иногда часы. Anthropic сообщила авторам отчёта, что работа её исследователей и инженеров всё больше смещается к проверке изменений и оркестровке агентов.
Где агенты слабы
Один из шести ключевых выводов отчёта: в суждении и надёжности агенты заметно уступают экспертам-людям.
Сильнее всего агенты там, где результат можно дёшево и быстро проверить и где допустимо пробовать много раз. В открытых задачах картина другая.
- •Аналитическую записку лучшей из моделей METR оценила ниже 20-го перцентиля среди тестовых работ кандидатов на такую должность.
- •Компания Andon Labs поручила модели управлять небольшим магазином в Сан-Франциско с бюджетом 100 тыс. долларов. Модель заказала тысячу чехлов на сиденья для служебного туалета и выставила их на продажу, а из-за ошибок в графике смен магазин три дня подряд был закрыт.
- •Redwood Research дала модели 5 тыс. долларов и задачу заработать. В четырёх прогонах результат ноль.
Авторы отмечают устойчивый разрыв: в реальной работе агенты слабее, чем следует из их результатов на тестах.
Что агенты делают и чего не делают
Отчёт сводит наблюдения в таблицу. Правый столбец это оценка METR, прямых подтверждений от компаний по нему меньше.
| Агенты часто делают сами | Ни в одной компании агенты не делают сами |
|---|---|
| Пишут сложные правки кода | Принимают изменения в критичный общий код |
| Анализируют данные и строят графики | Ставят исследовательские задачи |
| Находят сложные уязвимости | Принимают решения о безопасности |
| Сводят большие объёмы информации | Решают вопросы найма и бюджета |
| Оптимизируют отдельные показатели | Выносят итоговые суждения о рисках |
Сколько это даёт на деле
Повторный эксперимент METR с опытными разработчиками на агентах конца 2025 года показал ускорение на 4-20%. Авторы считают оценку заниженной: часть разработчиков отказалась участвовать, потому что работать без ИИ им уже невыгодно. В опросах те же люди называют прирост от 1,6 до 4 раз, и авторы напоминают, что самооценки раньше оказывались завышенными.
Два числа про качество. На конец 2025 года из решений ИИ, прошедших автоматические тесты, на реальном ревью приняли бы около половины. В длинных задачах, от восьми часов, не менее 16% успешных прогонов при ручной проверке оказались нечестными: агент обходил условия задачи. Проверка на такие обходы, по словам авторов, часто составляет большую часть работы по оценке.
Что это значит для небольшой компании
Отчёт описывает программирование и исследования. Принцип переносится на любую работу с документами и расчётами.
- 1Отдавать ИИ то, что легко проверить. Сверка, выборка, черновик по образцу, расчёт с контрольной суммой.
- 2Оставлять за человеком приёмку и решения, где цена ошибки высока.
- 3Считать проверку отдельной работой и закладывать на неё время. В компаниях, которые создают эти модели, она занимает заметную долю труда.
Подробнее о том, как меняются роли в команде, в обзоре «ИИ и узкая специализация».
Мақала тақырыбына қатысты қызмет
Қаржыға экспресс-диагностика
Қаржыға 5 күнде тәуелсіз көзқарас: 3-5 олқылық және алдымен нені түзету керектігінің жоспары