Исследование Microsoft: нейросети портят документы при выполнении сложных задач

Исследование Microsoft: нейросети портят документы при выполнении сложных задач

Группа исследователей Microsoft опубликовала результаты тестирования, согласно которым современные большие языковые модели (LLM) склонны вносить существенные ошибки в документы при их редактировании. Испытания 19 популярных нейросетей показали, что при выполнении сложных многоэтапных задач алгоритмы часто оказываются ненадежными и портят структуру исходных данных.

Суть эксперимента и бенчмарк DELEGATE-52

В основу работы лег созданный учеными бенчмарк под названием DELEGATE-52. Эта система позволяет симулировать типичные рабочие процессы офисных сотрудников. Исследование охватило 310 сценариев в 52 профессиональных областях, включая программирование, кристаллографию, генеалогию и нотную грамоту. В каждом сценарии использовались реальные документы объемом около 15 000 токенов (базовых единиц текста), для которых ИИ должен был выполнить от 5 до 10 сложных правок.

В отчете отмечается, что текущие модели являются «ненадежными исполнителями»: они допускают редкие, но серьезные ошибки, которые незаметно разрушают целостность документов. Этот эффект усиливается при длительном взаимодействии с нейросетью.

Ключевые выводы исследования:

  • Флагманские модели (такие как Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4) теряют в среднем 25% содержимого документа после 20 циклов правок.
  • Средний показатель деградации контента по всем протестированным моделям достигает 50%.
  • Единственной областью, где большинство моделей признаны «готовыми к работе», оказалось программирование на Python.
  • Наилучшие результаты одна из моделей показала лишь в 11 из 52 протестированных сфер деятельности.

Мнение экспертного сообщества

В обзоре ситуации директор по исследованиям Info-Tech Research Group Брайан Джексон отмечает, что подобные тесты крайне полезны для разработчиков корпоративного ИИ, стремящихся автоматизировать рабочие процессы. Однако он подчеркивает, что результаты не означают полную непригодность нейросетей. По словам эксперта, в корпоративной среде необходимо внедрять более строгие защитные барьеры.

Для предотвращения ошибок предлагается использовать архитектуру из нескольких агентов, где одна нейросеть выполняет правки, а вторая проверяет результат и вносит коррективы. Также возможен метод детерминированной проверки точности с помощью математической верификации выходных данных.

Главный аналитик Greyhound Research Санчит Вир Гогиа считает данный отчет серьезным предупреждением для руководителей ИТ-подразделений. Он подчеркивает, что главная проблема заключается не в «галлюцинациях» (выдумках ИИ), а в нарушении целостности артефактов — важных документов, таких как контракты, реестры, кодовые базы или отчеты для руководства. ИИ справляется с написанием текста, но пока не может гарантировать его сохранность при многократном редактировании.

Роль человека в автоматизированных процессах

Исследование опровергает теорию о том, что ИИ может полностью заменить сотрудников в ближайшее время. По мнению экспертов, меняется сама роль человека: из исполнителя он превращается в контролера и валидатора.

В анализе подчеркиваются следующие риски:

  • Ошибки имеют накопительный эффект: чем больше объем файла и чем дольше длится работа, тем выше риск искажений.
  • Слабые модели совершают очевидные ошибки, которые легко заметить. Флагманские модели действуют коварнее: контент остается на месте, но его смысл искажается или незаметно подменяется.
  • Сокращение штатных экспертов ради экономии может лишить компанию людей, способных вовремя заметить повреждение данных нейросетью.

Специалисты заключают, что на текущем этапе развития делегировать ИИ полную ответственность за важные документы преждевременно. Ответственность за любой ущерб, нанесенный нейросетью при редактировании отчетности или юридических документов, по-прежнему несет предприятие.

Еще кое-что по теме: