Taobao — агентный ИИ ускорил чат поддержки на 17%, но рейтинг клиентов упал примерно на 11,5%
Коротко. Taobao (Alibaba Group) провела 17-дневный полевой эксперимент с рандомизацией по сотрудникам: часть операторов получила агентного ИИ, который сам решает подходящие обращения, а человек подключается при эскалации. Чат стал…
Заголовок источника
Там, где агентный ИИ Taobao работал сам, чат стал быстрее, но клиенты стали оценивать его ниже
О статусе материала
review
Коротко. Taobao (Alibaba Group) провела 17-дневный полевой эксперимент с рандомизацией по сотрудникам: часть операторов получила агентного ИИ, который сам решает подходящие обращения, а человек подключается при эскалации. Чат стал быстрее, но там, где работал ИИ, клиенты ставили заметно более низкие оценки — падение примерно на 11,5% от среднего.
Что изменили
До эксперимента операторы послепродажной поддержки Taobao вели все чаты вручную. В тестовой группе агентный ИИ стал сам разрешать «подходящие» («AI-eligible») обращения: узкий, чётко очерченный класс запросов — меньше 10% всего потока (в выборке — 39 432 из 680 676 чатов, 5,8%). Сотрудник курировал работу ИИ и вмешивался при эскалации — технической или эмоциональной, а остальные чаты, «недоступные» ИИ, продолжал вести сам, попутно совмещая обе задачи. Эксперимент шёл 15–31 августа 2024 года; на следующий день после его окончания Taobao развернула агентную систему на всех сотрудников.
Как измерили
Это полевой рандомизированный эксперимент: 302 сотрудника в группе с ИИ и 345 в контрольной группе, распределение — по идентификатору сотрудника. Всего в выборке 647 человек и 680 676 чатов. Источник: препринт arXiv (2605.14830, май 2026), ещё не прошедший рецензирование. Из пяти авторов четверо работают в университетах (Zhejiang University, Fudan University, Dartmouth College), один — сотрудник Alibaba с доступом к платформенным данным. Из-за соавтора из Alibaba и платформенного происхождения данных уровень доказательности — B, а не A: второго независимого источника нет.
Измерения при этом объективные, по логам платформы (длительность чата, повторные обращения в окне 7 дней, рейтинг клиента по шкале 1–5). Похожий эксперимент той же исследовательской группы в Alibaba/Taobao описан в отдельной статье: там другая рандомизация и другой инструмент, поэтому это самостоятельное наблюдение, а не дубль.
Что получилось
По обращениям, доступным ИИ: длительность чата упала на 16,8% (p<0,001), а рейтинг клиента — на 0,412 балла по шкале 1–5 (p<0,001). При среднем рейтинге в выборке 3,57 это падение — около 11,5% от среднего значения. По обращениям, недоступным ИИ (где сотрудник работал как раньше, но в режиме многозадачности): длительность чата снизилась незначительно, на 1,8% (p<0,05), а рейтинг клиента, наоборот, вырос на 0,091 балла (p<0,01).
Эффект на долю повторных обращений в обеих категориях статистически незначим. Независимых публикаций о судьбе программы после августа 2024 года не найдено: что стало с рейтингами после полного развёртывания на всех сотрудников, неизвестно.
Почему так вышло
Сами авторы связывают падение рейтингов в «доступных ИИ» чатах не с качеством работы самого ИИ, а с поведением людей после эскалации: при «эмоциональных» эскалациях (раздражённый клиент) сотрудники проявляют меньшую вовлечённость — меньше сообщений, меньше проактивности — чем при «технических» эскалациях. То есть проблема, по их трактовке, в том, как человек подхватывает уже испорченный контакт, а не в самом решении ИИ. Рост рейтингов по «недоступным» ИИ чатам авторы фиксируют как положительный побочный эффект; его механизм в открытых данных не описан.
Чему учит
- Ускорение чата и удовлетворённость клиента — разные метрики, и агентный ИИ может улучшить одну за счёт другой именно там, где работает.
- Побочный эффект бывает положительным: в этом эксперименте оценки выросли и там, где ИИ не работал, хотя причина не установлена.
- Момент эскалации к человеку — критическая точка: по трактовке авторов, оценки падали там, где сотрудник после передачи от ИИ меньше вовлекался в разговор с раздражённым клиентом.
- Узкий охват (менее 10% потока) — не повод расслабляться: даже на небольшом сегменте падение оценок статистически значимо и заметно по величине.
Источники
- Agentic AI and Human-in-the-Loop Interventions: Field Experimental Evidence from Alibaba's Customer Service Operations — arXiv, препринт, май 2026 (не рецензирован).
Уровень доказательности: B. Рандомизированный полевой эксперимент с объективными платформенными метриками, но без второго независимого источника — один из пяти авторов аффилирован с Alibaba, данные платформенные. Источник — препринт без рецензирования. Судьба программы после сентября 2024 года неизвестна: программу развернули на всех сотрудников, но публичных данных о дальнейшей динамике рейтингов нет.