Skip to content
All articles
Управление

Что ИИ-агенты уже делают сами и что остаётся за людьми: срез весны 2026 года

Что ИИ-агенты уже делают сами и что остаётся за людьми: срез весны 2026 года

METR получила доступ к внутренним моделям Anthropic, Google, Meta и OpenAI. Агенты сами ведут проекты на часы и дни работы, но в суждении и надёжности заметно уступают экспертам. Разбираем, где проходит граница.

О возможностях ИИ обычно судят по демонстрациям и рекламе. Весной 2026 года появился редкий источник другого рода: независимая организация посмотрела, как агенты работают внутри компаний, которые их создают.

Откуда данные

METR, исследовательская организация, оценивающая передовые модели, провела с 16 февраля по 16 марта 2026 года пилотную оценку. Anthropic, Google, Meta и OpenAI дали доступ к своим самым сильным внутренним моделям и ответили на подробный опросник о том, как используют ИИ у себя. Отчёт опубликован 19 мая 2026 года.

Задача отчёта была оценить риски автономных агентов. Для нас важен побочный результат: трезвая картина того, что агенты умеют и чего пока нет.

Что агенты делают сами

Возможности выросли сильно. По замерам METR агенты справляются с проектами, которые у человека заняли бы часы и дни, а на задачах переписывания программ по спецификации решали работу, требующую от человека недель.

Изменилась и практика. Ещё в конце 2025 года в самой METR агентов держали под плотным надзором: небольшие правки, каждую утверждает человек. К весне 2026 года инженеры оставляют агента работать десятки минут, иногда часы. Anthropic сообщила авторам отчёта, что работа её исследователей и инженеров всё больше смещается к проверке изменений и оркестровке агентов.

Где агенты слабы

Один из шести ключевых выводов отчёта: в суждении и надёжности агенты заметно уступают экспертам-людям.

Сильнее всего агенты там, где результат можно дёшево и быстро проверить и где допустимо пробовать много раз. В открытых задачах картина другая.

  • •Аналитическую записку лучшей из моделей METR оценила ниже 20-го перцентиля среди тестовых работ кандидатов на такую должность.
  • •Компания Andon Labs поручила модели управлять небольшим магазином в Сан-Франциско с бюджетом 100 тыс. долларов. Модель заказала тысячу чехлов на сиденья для служебного туалета и выставила их на продажу, а из-за ошибок в графике смен магазин три дня подряд был закрыт.
  • •Redwood Research дала модели 5 тыс. долларов и задачу заработать. В четырёх прогонах результат ноль.

Авторы отмечают устойчивый разрыв: в реальной работе агенты слабее, чем следует из их результатов на тестах.

Что агенты делают и чего не делают

Отчёт сводит наблюдения в таблицу. Правый столбец это оценка METR, прямых подтверждений от компаний по нему меньше.

Агенты часто делают самиНи в одной компании агенты не делают сами
Пишут сложные правки кодаПринимают изменения в критичный общий код
Анализируют данные и строят графикиСтавят исследовательские задачи
Находят сложные уязвимостиПринимают решения о безопасности
Сводят большие объёмы информацииРешают вопросы найма и бюджета
Оптимизируют отдельные показателиВыносят итоговые суждения о рисках

Сколько это даёт на деле

Повторный эксперимент METR с опытными разработчиками на агентах конца 2025 года показал ускорение на 4-20%. Авторы считают оценку заниженной: часть разработчиков отказалась участвовать, потому что работать без ИИ им уже невыгодно. В опросах те же люди называют прирост от 1,6 до 4 раз, и авторы напоминают, что самооценки раньше оказывались завышенными.

Два числа про качество. На конец 2025 года из решений ИИ, прошедших автоматические тесты, на реальном ревью приняли бы около половины. В длинных задачах, от восьми часов, не менее 16% успешных прогонов при ручной проверке оказались нечестными: агент обходил условия задачи. Проверка на такие обходы, по словам авторов, часто составляет большую часть работы по оценке.

Что это значит для небольшой компании

Отчёт описывает программирование и исследования. Принцип переносится на любую работу с документами и расчётами.

  1. 1Отдавать ИИ то, что легко проверить. Сверка, выборка, черновик по образцу, расчёт с контрольной суммой.
  2. 2Оставлять за человеком приёмку и решения, где цена ошибки высока.
  3. 3Считать проверку отдельной работой и закладывать на неё время. В компаниях, которые создают эти модели, она занимает заметную долю труда.

Подробнее о том, как меняются роли в команде, в обзоре «ИИ и узкая специализация».

Related service

Express Financial Diagnostics

An independent look at your finances in 5 days: 3-5 findings and a plan for what to fix first

Learn more

Start with a 30-minute consultation

Free and with no obligations: we will review your task, propose a working format, and quote the cost. If your team can solve it on its own, we will say so directly.

We respond within 1 business day