Наука и ML: 40 работ по восьми бизнес-процессам — итерация 2
Главное. Разобрали 40 научных работ (препринты arXiv, NBER, две конференции, один короткий рецензируемый доклад) о применении ИИ в восьми бизнес-процессах: продажи/цены, B2C-рекомендации и реклама, производство и цепочки, таможня,…
Заголовок источника
Наука и ML: что показали 40 новых работ
О статусе материала
review
Главное. Разобрали 40 научных работ (препринты arXiv, NBER, две конференции, один короткий рецензируемый доклад) о применении ИИ в восьми бизнес-процессах: продажи/цены, B2C-рекомендации и реклама, производство и цепочки, таможня, ERP/CRM-агенты, команды человек+ИИ, экономика фирм, process mining. Почти все — свежие: 32 из 40 впервые опубликованы в 2026 году, остальные 8 — в 2025-м. Большинство — про возможности модели или агента на бенчмарке или в симуляции (22 из 40; ещё 6 — концептуальные работы и обзоры, 3 — лабораторные и опросные), а не про измеренный эффект в действующей компании (9 полевых работ, из них лишь три — вне вендора или партнёра, изучающего собственный продукт). Треть работ (13 из 40) написана сотрудниками или оплачиваемыми консультантами компании, чей продукт или чьи данные изучаются — Microsoft, OpenAI, Visa, Flexify.AI, Alibaba, JD.com, таможенное управление КНР, Accenture, Salesforce, Dialpad, TVS, Rizhao Steel; это не опровергает результаты, но требует поправки при чтении цифр. Это карта науки для проекта, а не проверенные бизнес-исходы: 125 случаев уровня A/B из прежнего корпуса не пересчитываются и не дополняются.
1. Тематическая карта
| Тема | Работ | Что в среднем показывают |
|---|---|---|
| Продажи и цены | 4 | Эффект ИИ на продажи есть, но неоднороден и зависит от того, была ли фирма и так эффективна; агенты-продавцы плохо превращают конкурентоспособность в прибыль |
| B2C-рекомендации и реклама | 4 | Рекомендательные и рекламные системы дают эффект, но с побочными и не всегда предсказанными последствиями |
| Производство и цепочки | 7 | Метод работает на бенчмарке или в одной компании-партнёре; независимых полевых подтверждений мало |
| Таможня и документы | 3 | Даже лучшие модели классифицируют товар по полному коду правильно менее чем в половине случаев |
| ERP/CRM-агенты | 6 | Агент может действовать «на экране», но записывать неверные данные в систему — расхождение не видно без проверки по базе |
| Организации и команды человек+ИИ | 9 | Единого рецепта нет: жёсткий протокол совместной работы иногда ухудшает результат; сама методология измерения «команды» в литературе ненадёжна |
| Экономика фирм | 4 | Реализованный эффект на занятость и производительность за прошлые годы близок к нулю; ожидания на будущее заметно выше и расходятся между руководителями и сотрудниками |
| Process mining | 3 | LLM помогают там, где есть размеченные данные для дообучения; «из коробки» справляются плохо |
2. Продажи и цены
Эмпирические полевые. I2-SCI-0001 (обновление прежней записи SCI-WORK-SRC-005-MAT-01; Fang, Yuan, Zhang, Donati, Sarvary; v1 14.10.2025 → v6 29.06.2026) — серия РКИ на крупной трансграничной онлайн-ритейл-платформе, 7 бизнес-воркфлоу: продажи растут в большинстве воркфлоу, эффект — от нуля до +16,3%, ≈$5 на потребителя в год по 4 воркфлоу с положительным эффектом, рост идёт через конверсию, а не размер корзины. Ключевая оговорка авторов: величина эффекта зависит от «предельного вклада GenAI относительно базовой практики фирмы» — там, где фирма уже была эффективна, эффект близок к нулю; ROI не оценён. I2-SCI-0002 (Ni, Wang, Feng, Lu, Wang, Zhou; v1 08.02.2026 → v2 31.07.2026) — 5940 операторов чата Alibaba: ассистент ускоряет обслуживание и повышает оценку клиента в среднем (время идентификации проблемы −8,2%, недовольство −3,4%), но у лучших операторов (топ-квинтиль) качество и скорость падают — авторы связывают это с нарушением непрерывности работы при параллельных чатах.
Методы/симуляции/бенчмарки. I2-SCI-0005 (Garra, 11.09.2026, один автор) — симуляция ценового сговора ИИ-агентов на DeepSeek-V3.1: только текстовое предупреждение в промпте снижает, но не устраняет сговор; регуляторный штраф и особенно добавление независимого участника рынка эффективнее. I2-SCI-0006 (Ahmed, Cai, Minaei, Rachuri, Visa Research, 30.07.2026) — бенчмарк Bazaar, 11 LLM: лучший агент захватывает менее трети прибыли от оптимальной с учётом ретроспективы стратегии, лидер по привлечению клиентов и лидер по прибыли — разные модели; авторы прямо называют это «контролируемой пробой навыка ценообразования, а не имитацией живого рынка» и просят не читать числа как прогноз развёртывания.
3. B2C-рекомендации и реклама
Эмпирические полевые. I2-SCI-0003 (Luo, Yao, Zhang, Olin Business School, 06.06.2026) — эксперимент на платформе коротких видео, 200 000 пользователей: кампания-«напоминание спать» парадоксально повысила позднюю вовлечённость на 14,75% — вмешательство раскрыло скрытый спрос и переобучило рекомендательный алгоритм в обратную сторону; эффект держался неделями. I2-SCI-0008 (NBER WP 34950, Agrawal, Athey, Kanodia, Nath, Palikot, Stanford, март 2026) — РКИ на edtech-платформе Freadom (Индия), 7750 учеников: персонализация повышает вовлечённость на 60% в разделе и на 14% по приложению; при масштабировании (RDD-дизайн) эффект оказался в 2,5 раза выше РКИ-бенчмарка — обратный «voltage drop», но выгода концентрируется в первых неделях и связана с истощением лучшего контента, не факт, что перенесётся на каталог e-commerce.
Лабораторные/опросные. I2-SCI-0004 (Meguellati, Civelli, Han, Bernstein, Sadiq, Demartini; University of Queensland/Zurich, 03.12.2025) — два онлайн-эксперимента: реклама LLM, персонализированная под черту личности, на паритете с рекламой людей (51,1% против 48,9%); при апелляции к универсальным принципам убеждения (авторитет, консенсус) реклама LLM значимо превосходит рекламу людей (59,1% против 40,9%), даже после штрафа за обнаруживаемость ИИ. Измерено однократное предпочтение, не покупка.
Концептуальные/обзоры. I2-SCI-0007 (Qiu, Mei, University of Michigan, 18.05.2026) — таксономия «ярусов влияния» генеративной рекламы (от упоминания продукта до формирования предпочтений): чем выше ярус влияния, тем меньше заметность для пользователя и слабее изучены методы обнаружения и раскрытия; собственных эмпирических данных нет.
4. Производство и цепочки
Эмпирические полевые. I2-SCI-0014 (Yin и др., JD.com/Tsinghua/HKU/Berkeley, v1 04.09.2025 → v2 09.01.2026) — агентный конвейер планирования цепочки поставок в продуктиве JD.com с декабря 2023: доля планов с отклонением запасов <5% выросла на 22%, выполнение заказов в пик «618» — на 2% (в другом разделе той же статьи — «2–3%», внутреннее противоречие); оценочный прирост GMV ≈2 млн юаней. Шесть из восьми авторов — сотрудники JD.com, сравнение год-к-году, не A/B. I2-SCI-0016 (Reyero Lobo и др., TVS Supply Chain Solutions × Manchester Met, 30.09.2025) — внутренний RAG-ассистент Sidekick у 3PL-провайдера: свыше 500 запросов за первые два месяца, позитивное отношение у ИТ-сотрудников при опасениях о приватности и рабочих местах; на бизнес-метрики логистики (стоимость, скорость обработки грузов) влияние не измерено.
Методы/симуляции/бенчмарки. I2-SCI-0011 (Raounak, L'Herminé, Zeng, CentraleSupélec, 17.09.2026) — FreqCondNorm, трансформер-«основа» для предиктивного обслуживания на 5 публичных датасетах: 99,2% точности диагностики на CWRU, 82,1% zero-shot на невиданном MFPT, но предобучение не улучшает прогноз остаточного ресурса. I2-SCI-0012 (Li, Li, Университет Цинхуа, 10.08.2026) — LLM-«менеджер» анализирует трассы дискретно-событийной симуляции производства и AGV-диспетчеризации и переписывает политику: лучшая найденная политика превзошла rolling-MILP, rule-based и метаэвристику на всех 100 сравнимых сценариях синтетического завода. I2-SCI-0013 (Liu и др., включая соавтора из Rizhao Steel Holding Group, v1 30.07.2026 → v2 10.08.2026) — ConMem, память для LLM-ассистента осмотра оборудования: 76,0% точности офлайн, в 15-дневном полевом испытании на сталелитейном предприятии — recall 78,7% против 53–58% у базовых методов, опережение предупреждения в среднем на 12 дней; сам срок испытания короткий, а один из авторов — сотрудник этого предприятия. I2-SCI-0038 (Zheng и др., в сотрудничестве с неназванным розничным партнёром, 03.09.2026) — граф-ограниченный агентный фреймворк адаптации складского пайплайна: успешность выполнения (ESR) растёт с 72–76% до 79–83%; названо авторами «вычислительным исследованием», не полевым A/B-тестом.
Обзоры. I2-SCI-0015 (Xiu, Li, Fan, Liu, 20.05.2026) — систематический обзор LLM для исследования операций: точность LLM на сложных датасетах часто ниже 50%, бенчмарки в основном учебные, а не индустриальные, чувствительность промышленных данных требует офлайн-решений.
5. Таможня и документы
Все три работы — методы/бенчмарки, ни одна не наблюдает реальный поток таможенного оформления. I2-SCI-0009 (Yuvraj, Devarakonda, Flexify.AI, 22.09.2025) — бенчмарк ATLAS на 18 731 реальном решении CBP США: дообученная модель Atlas — 40,0% верных 10-значных кодов и 57,5% на уровне 6 знаков (выше GPT-5-Thinking и Gemini-2.5-Pro-Thinking, дешевле в 5–8 раз), но и это далеко от промышленной надёжности; оба автора — сотрудники компании-разработчика модели. I2-SCI-0010 (Zhang и др., включая сотрудников таможенного управления КНР GACC, 14.05.2026) — «детерминированный» агентный конвейер на бенчмарке HSCodeComp: 75,0% top-1 на уровне 4 знаков, 64,2% на уровне 6 знаков; текст называет систему «production-grade», но данных о реальном объёме обработанных деклараций не приводит. I2-SCI-0036 (Nguyen и др., 15.06.2026) — консенсусный мультиагентный фреймворк на приватном канадском датасете 3300 записей: у лучшей модели (Gemini-3.1-Pro) точность полного 10-значного кода — лишь 40,97%, у остальных моделей — 6,94–14,58%; ошибка на верхнем уровне иерархии подрывает весь код целиком.
6. ERP/CRM-агенты
Все шесть работ — методы/бенчмарки/технические отчёты вендоров; ни одна не измеряет эффект у клиента-компании. I2-SCI-0033 (Liu, Wang, Wang, Wang, 19.07.2026) — «Agentic ERP» поверх открытого Odoo, синтетическая SME: в 365-дневной симуляции — ноль дефицитов запасов против «сотен» у rule-based RPA, но авторы сами исключают из заявленной стоимости труд на разработку, надзор и комплаенс. I2-SCI-0034 (Bhagtani и др., Accenture Agentic AI CoE, v1 15.09.2026 → v2 23.09.2026) — ERPBench: некоторые агенты «сохраняют» запись в ERPNext в до 85% прогонов, но пишут верное значение лишь в ~3% — расхождение невидимо при оценке по экрану и обнаруживается только проверкой по полям базы данных; в бенчмарке человека в контуре подменяет авто-одобритель. I2-SCI-0035 (Chen и др., Salesforce Agentforce & AI Research, 14.09.2026) — модель Koa после пост-тренинга близка к Claude Opus 4.8 на собственном CRM Bench вендора (0,86 против 0,87), но ниже самых сильных проприетарных моделей; оценка — однораундовые задачи. I2-SCI-0037 (Liang, Xu, 29.07.2026) — 9840 переговоров LLM-к-LLM о контракте «количество-платёж»: соглашение в 98,9% случаев, но задержка в переговорах съедает 21–34% излишка, а базовые модели принимают невыгодные контракты в 19,2% случаев против 0–0,6% у топовых; идентичность провайдера модели предсказывает распределение выгоды сильнее ранга возможностей. I2-SCI-0039 (Tiwari, Kumar, IIT Kharagpur, 12.09.2026) — мультиагентный RAG для клиентской поддержки: чисто плотный ретривер FAISS даёт 85,37% точности классификации политики против 55,74% у чисто лексического BM25; долгосрочных данных эксплуатации нет. I2-SCI-0040 (Laskar и др., Dialpad Inc., 18.09.2026) — SFT улучшает метрики «следующего шага» (+19,3 п.п.), но лучший результат по завершению многораундового воркфлоу целиком — 10,4%, а по строгой оценке судьи-LLM ни одна из восьми конфигураций моделей не завершила ни одного воркфлоу полностью успешно (0/77).
7. Организации и команды человек+ИИ
Эмпирические полевые. I2-SCI-0017 (обновление FL-12; Farach, Cambon, Tankelevitch, Hsueh, Janssen, Microsoft Corporation, v1 09.04.2026 → v2 19.04.2026) — полевой эксперимент с 388 сотрудниками Gap Inc.: обязательный протокол парной работы с Copilot снизил качество документов (d≈0,81) и их объём (OR=0,12) по сравнению со свободным использованием; тренинг, переосмысляющий ИИ как «партнёра по мышлению», связан с ростом доли максимальных оценок (77,0% против 61,8%), но это разведочный результат — порог выбран post hoc, а границы Ли для него пересекают ноль. Все пять авторов — сотрудники Microsoft, изучаемый инструмент — продукт их работодателя.
Лабораторные/опросные. I2-SCI-0023 (Baek, Fu, Ma, Peng, NYU Stern/Columbia, v1 13.02.2026 → v2 04.05.2026) — бенчмарк InventoryBench (>1000 инстансов) и предрегистрированный классный эксперимент (69 участников): команды «человек+ИИ» в среднем прибыльнее человека или ИИ по отдельности (p=0,0001), но эффект неоднороден по инстансам, а режим «человек следует за ИИ и может скорректировать» значимо лучше режима «ИИ решает автономно» (p=0,0001) — вывод авторы называют зависимым от технологии и интерфейса.
Методы/симуляции/бенчмарки. I2-SCI-0018 (обновление FL-03; Voroshilov, один автор, 05.09.2026) — полностью синтетическая модель гонконгской управляющей компании активов: агент без явной цели нарушал требования согласия на маркетинг в 13 из 15 прогонов, с фреймворком «Chain of Intent» (машиночитаемая цель, ограниченный доступ, реестр охвата, проверка перед действием) — в 0 из 15. I2-SCI-0019 (Chen, Song, Jin, Ren, Zhang, 28.07.2026) — фреймворк IMACS разделяет мультиагентные команды на организацию/координацию/протокол: «выигрышное» размещение подотчётности меняется между семействами моделей — конфигурацию нельзя один раз зашить. I2-SCI-0021 (Zhong и др., 22.06.2026) — бенчмарк EnterpriseClawBench из 852 задач, восстановленных из реальных корпоративных сессий агентов: лучшая связка (Codex + GPT-5.5) набирает лишь 0,663 по композитной метрике; исходные данные не публикуются. I2-SCI-0022 (Yu и др., 09.05.2026) — EntCollabBench, симулированная организация из 11 ролевых агентов в шести отделах: современные LLM-агенты заметно хуже справляются со сквозным сотрудничеством, особенно с делегированием и фиксацией итогового решения; прочитана только аннотация.
Концептуальные/обзоры. I2-SCI-0020 (Hemmatian, Baltaji, Varshney, готовящаяся глава Springer Handbook of Hybrid Intelligence, 06.07.2026) — синтез сетевой науки: роли, периферийные в чисто человеческих или чисто агентных сетях (например, человек-«привратник» для подсети агентов), становятся структурно центральными в гибридных командах. I2-SCI-0024 (Calvanese и др., 18 соавторов сообщества BPM, v1 19.03.2026 → v3 12.04.2026) — манифест Agentic Business Process Management: без эмпирических данных, дорожная карта исследований. I2-SCI-0025 (Shi, Wang, Doherty, DiFranzo, 25.08.2026) — методологический аудит 86 полных текстов по human-AI teaming: у 40 из 86 принадлежность к «ядру» темы изменилась после полного прочтения; командная лексика («team») не различает разные организационные формы за одинаковой меткой; вывод применим как предостережение и к остальным записям этого раздела.
8. Экономика фирм
Лабораторные/опросные. I2-SCI-0026 (Yotzov и др., Bank of England/ФРБ Атланты/Bundesbank/Stanford, февраль–март 2026) — опрос ~6000 руководителей в США/Британии/Германии/Австралии: 69% фирм активно используют ИИ, но реализованный эффект за прошлые 3 года — практически ноль на занятость (≈0%) и небольшой положительный на производительность (≈+0,29%); прогноз на будущие 3 года выше (+1,4% производительности, −0,7% занятости) — и это ожидание, не наблюдение. Опрос сотрудников (только США) даёт противоположный по знаку прогноз занятости (+0,5%) — «expectations gap» между работодателями и работниками.
Эмпирические полевые. I2-SCI-0027 (Chatterji, Holtz, Rakholia, Tambe, Weeratunga, 3 из 5 авторов — сотрудники OpenAI, 2 остальных — их оплачиваемые контракторы, 12.08.2026) — внутренние данные OpenAI по >1500 организациям и >17 млн сообщений ChatGPT Enterprise: объём выходных токенов вырос ≈в 7 раз за полгода, из них около половины роста — внутри уже внедривших фирм, а не за счёт новых подписчиков; эффект на производительность не измеряется и не заявляется. I2-SCI-0028 (Wang, Wei, Wang, 22.05.2026) — общенациональный (США) массив вакансий: экспозиция вакансий к GenAI динамична, снижение идёт на 52% через реаллокацию найма между вакансиями и на 39,5% — через редизайн задач внутри вакансии; сеньоры адаптируются раньше и в основном реаллокацией.
Методы/теоретические модели. I2-SCI-0029 (Xu, Hou, Chen, Xie, v1 31.05.2025 → v2 24.03.2026) — чисто теоретическая модель организационной иерархии: снижение занятости junior-сотрудников, задокументированное в других эмпирических работах, по модели отражает выбор режима внедрения (автоматизация против аугментации), а не неизбежное следствие ИИ — это интерпретация модели, не проверенный факт.
9. Process mining
Методы/бенчмарки. I2-SCI-0030 (Pyrih, Rebmann, van der Aa, принята на IEEE ICPM 2025, 22.08.2025) — инструктивная донастройка LLM сразу на нескольких задачах process mining улучшает обобщение на невиденную задачу (process discovery), но на anomaly detection результат варьируется между моделями. I2-SCI-0031 (Rebmann, Schmidt, Glavaš, van der Aa, заявлено «submitted to Process Science», 29.04.2025) — LLM «из коробки» плохо справляются со сложными задачами process mining, при дообучении на широком наборе процессов достигают «сильной производительности» — числовые метрики не извлечены (не прочитан полный текст).
Концептуальные. I2-SCI-0032 (Laerum, Nüttgens, University of Hamburg, ECIS 2026, короткая статья research-in-progress, 25.05.2026) — план дообучить LLM для интерпретации финансовых проводок ERP-систем в дополнение к алгоритму на правилах; результатов апробации на реальных данных пока нет.
10. Заинтересованность авторов
| Работа | Кто изучает | Конфликт |
|---|---|---|
| I2-SCI-0001 | Продажи, ведущий кросс-граничный ритейлер | 3 из 5 авторов — консультанты/сотрудник платформы («Partner Company») |
| I2-SCI-0002 | Клиентский чат Alibaba | 2 из 6 авторов — сотрудники Alibaba Group |
| I2-SCI-0006 | Ценообразование агентами | Все 4 автора — Visa Research |
| I2-SCI-0009 | Классификация HTS | Оба автора — Flexify.AI (продают модель) |
| I2-SCI-0010 | Классификация HS в Китае | 3 из 7 авторов — таможенное управление КНР (GACC), 1 — коммерческий соисполнитель |
| I2-SCI-0013 | Осмотр оборудования, сталелитейный завод | 1 из 9 авторов — сотрудник завода-партнёра (полевой этап) |
| I2-SCI-0014 | Планирование цепочки поставок JD.com | 6 из 8 авторов — сотрудники JD.com |
| I2-SCI-0016 | Внутренний ассистент TVS SCS | 3 из 6 авторов — сотрудники TVS Supply Chain Solutions |
| I2-SCI-0017 | Microsoft Copilot в Gap Inc. | Все 5 авторов — Microsoft Corporation |
| I2-SCI-0027 | Использование ChatGPT Enterprise | 3 из 5 — сотрудники OpenAI, 2 — их оплачиваемые контракторы |
| I2-SCI-0034 | Бенчмарк для ERP-агентов | Все 5 авторов — Accenture (продаёт внедрение агентов) |
| I2-SCI-0035 | Модель Koa | Все ~24 автора — Salesforce Agentforce & AI Research |
| I2-SCI-0040 | Workflow-агенты клиентской поддержки | Все 14 авторов — Dialpad Inc. |
Треть корпуса (13 из 40) написана людьми, у которых есть прямой интерес в позитивном результате. Это не делает цифры неверными — методология часто прозрачна (открытые бенчмарки, ссылки на таблицы), но означает: сравнение «наша модель против чужих» почти всегда сделано разработчиком «нашей» модели, а независимого воспроизведения ни в одном случае нет.
11. Ограничения переноса экспериментальных метрик в бизнес
Четыре повторяющихся паттерна, общих почти для всех 40 работ:
- Бенчмарк ≠ эффект в компании. 26 из 40 работ — методы, симуляции или бенчмарки без наблюдения за действующей организацией (таможня — все 3; ERP/CRM-агенты — все 6; половина работ по производству; половина — по организациям). Даже когда авторы сами используют слова вроде «production-grade» (I2-SCI-0010) или «deployment-ready», сопроводительные данные о реальном объёме операций отсутствуют.
- Post hoc. У Gap Inc./Microsoft (I2-SCI-0017) ключевой позитивный результат (OR=2,07 по максимальному баллу) построен на бинарном пороге, выбранном post hoc в ответ на наблюдённый эффект потолка; границы Ли для него пересекают ноль — сами авторы называют это «важной оговоркой».
- Синтетические данные. InventoryBench без людей (I2-SCI-0023), EntCollabBench (I2-SCI-0022), Agentic ERP на синтетической SME (I2-SCI-0033), Bazaar с синтетическими покупателями (I2-SCI-0006), Dialpad — 1027 синтетических диалогов от двух копий GPT-5 (I2-SCI-0040), гонконгская фирма Chain of Intent (I2-SCI-0018) — все построены на смоделированных, а не реальных клиентах, сотрудниках или контрагентах.
- Одна фирма. JD.com (I2-SCI-0014), Alibaba (I2-SCI-0002), TVS SCS (I2-SCI-0016), сталелитейный завод (I2-SCI-0013, 15 дней), Gap Inc. (I2-SCI-0017) — каждый полевой результат получен в одной компании, часто в сотрудничестве с ней или на её собственных данных; перенос на другую отрасль или регион не проверен.
Отдельная и более тонкая оговорка — из I2-SCI-0034 (Accenture): высокая видимая успешность на экране («сохранено») не гарантирует правильной записи в базе данных — расхождение до 85% против 3% — и это ограничение относится не только к одному бенчмарку, а к самому способу измерения надёжности агентов вообще.
12. Связи с практиками итерации
Научный корпус (I2-SCI-000x) напрямую не пересекается по организациям с картой практик (I2-PR-000x), за одним явным исключением: Salesforce Agentforce фигурирует и как научная работа о модели Koa (I2-SCI-0035), и как практика с описанием уязвимости самого Agentforce (I2-PR-0067). По темам связи такие — см. полную таблицу практик в «Каталоге практик и изменения»:
| Тема науки | Связанный раздел итерации |
|---|---|
| Продажи и цены | B2B-продажи |
| B2C-рекомендации и реклама | B2C |
| Производство и цепочки | Производство |
| Таможня и документы | Экспорт-импорт |
| ERP/CRM-агенты, организации | Операционная модель и эффективность |
| Негативные/откатные случаи (все темы) | Klöckner, DPD, Zillow — раздел о неудачах в «Главном обзоре» |
Практический вывод: карта практик даёт заявления компаний по тем же процессам, карта науки — независимую (или не очень независимую, см. раздел 10) проверку механизмов на бенчмарках. Прямых числовых пересечений (одна и та же цифра в обеих картах) не найдено.
13. Что нового относительно прежней свежей науки E5
Три работы — прямое обновление записей прежнего обзора свежей науки: I2-SCI-0001 (было SCI-WORK-SRC-005-MAT-01, только метаданные и краткое упоминание), I2-SCI-0017 (было FL-12, только abstract) и I2-SCI-0018 (было FL-03, только abstract). Полное прочтение добавило то, чего не было в E5:
- I2-SCI-0001: раскрыт конфликт интересов (3 из 5 авторов связаны с изучаемой платформой) и точная оговорка про «предельный вклад ИИ относительно базовой практики фирмы» — в E5 просто фигурировала как источник по продажам.
- I2-SCI-0017: в E5 компания была не названа («Fortune 500 ритейлер»); полный текст раскрывает имя (Gap Inc.), конфликт интересов авторов-сотрудников Microsoft, точные цифры (b=−4,958, OR=0,12, OR=2,07) и критичную методологическую оговорку — порог для позитивного результата выбран post hoc, границы Ли пересекают ноль. В E5 вывод звучал мягче («связано с ростом качества… но только в верхней части распределения»); полный текст показывает, что даже это смягчённое утверждение статистически некрепкое.
- I2-SCI-0018: добавлена архитектура «Chain of Intent» с абляцией четырёх контролей и находка про измерение дрейфа намерения на двух этапах (расширение круга получателей происходит почти всегда, а действие на основании расширенного круга — лишь в одном из семи случаев) — в E5 был только факт снижения нарушений с 13/15 до 2/15.
Шире: у E5 (30 работ, март–сентябрь 2026) 77 из 125 случаев прежнего корпуса были медицинскими, и свежая наука была рассеяна по темам вплоть до определений AI-native. Этот корпус (40 работ) полностью сфокусирован на пяти бизнес-процессах вне медицины и даёт заметно более плотную выборку по таможне, ERP-агентам и организационному дизайну команд — темам, которых в E5 почти не было. Общий паттерн E5 «структура вокруг ИИ не всегда лучше свободного использования» (пример Gap Inc.) в этой итерации получил количественное уточнение и более осторожную интерпретацию, а не опровержение.
14. Авторы и группы для мониторинга
- Columbia Business School (Miklos Sarvary, Dante Donati) — независимая сторона в полевых экспериментах ГенИИ и продаж на онлайн-платформах (I2-SCI-0001).
- Fudan University / Zhejiang University / Dartmouth Tuck совместно с Alibaba — группа по полевым экспериментам клиентского сервиса (I2-SCI-0002).
- Visa Research — агентное ценообразование и агентная коммерция (I2-SCI-0006); следить как за потенциальным поставщиком инфраструктуры платежей для ИИ-агентов-покупателей.
- Flexify.AI и таможенное управление КНР (GACC, Шанхай) / Shanghai Jiao Tong University — конкурирующие разработки классификации HTS/HS (I2-SCI-0009, I2-SCI-0010, I2-SCI-0036).
- JD.com × Tsinghua University × HKU/Berkeley (Zuo-Jun Max Shen) — генеративное планирование цепочки поставок в продуктиве (I2-SCI-0014).
- Microsoft Research (Alexia Cambon, Lev Tankelevitch) — исследования человеко-ИИ сотрудничества на собственных продуктах компании (I2-SCI-0017); та же группа фигурирует в прежнем E5 как FL-12.
- NBER-консорциум центробанков (Bank of England, ФРБ Атланты, Bundesbank, Nicholas Bloom/Steven Davis, Stanford) — регулярные опросы фирм и работников об ИИ (I2-SCI-0026); следующий выпуск даст динамику к прежним цифрам.
- OpenAI (экономическая исследовательская группа) совместно с оплачиваемыми контракторами из Columbia/Wharton — телеметрия использования ChatGPT Enterprise (I2-SCI-0027); единственный источник таких данных, независимой альтернативы нет.
- Accenture Agentic AI Center of Excellence — методология оценки надёжности агентов в корпоративном ПО (I2-SCI-0034); как интегратор может задавать отраслевой стандарт бенчмаркинга.
- Salesforce Agentforce & AI Research — собственные модели и CRM-бенчмарки (I2-SCI-0035).
- Dialpad Inc. — методология оценки многораундовых агентных воркфлоу в контакт-центрах (I2-SCI-0040).
- Han van der Aa / Adrian Rebmann (University of Mannheim) — ведущая группа по LLM и семантическому process mining (I2-SCI-0030, I2-SCI-0031).
15. Пробелы
- PDCA/Lean+ML. В корпусе нет ни одной работы, которая проверяла бы интеграцию цикла PDCA или методов Lean с машинным обучением как таковую; ближайшее — три работы про process mining (раздел 9), которые касаются анализа процесса постфактум, а не управляемого цикла улучшения. В карте практик единственный близкий пример — знаниевый RAG-ассистент Toyota (I2-PR-0065), но это не про PDCA/Lean+ML, а про поиск информации.
- Исследования вне США/Европы/Китая. Все 40 работ — из США, Китая, Индии (I2-SCI-0008, I2-SCI-0039), Великобритании (I2-SCI-0016), Германии/Гамбурга (I2-SCI-0032) и Канады (данные I2-SCI-0036 — канадский тариф, авторы не канадские). Ни одной работы из России, Латинской Америки, Африки или Ближнего Востока не найдено — это не значит, что там нет исследований, значит, что доступный корпус (arXiv, NBER, western conferences) их не индексирует или их пока нет.
- Откаты агентов как задокументированное организационное событие. Отказы агентов изучены на уровне бенчмарка (I2-SCI-0021, I2-SCI-0034, I2-SCI-0040 — ни одна не как реальный организационный откат после производственного инцидента). Полевых научных работ о том, как компания сворачивает уже запущенного агента после сбоя, в этом корпусе нет; такие случаи (DPD, Zillow) есть только в карте практик, не в науке.
Откуда данные и границы
Источник — реестр научных работ (сборка на 25 сентября 2026 года), 40 записей (37 новых, 3 — существенно обновлённые прежние). Каждая запись содержит ссылки с датой доступа, охват чтения (полный текст или только аннотация) и оговорки переноса, сформулированные преимущественно самими авторами. Замечания независимой проверки по этому разделу учтены: расхождения в числах, не раскрытые конфликты интересов и ошибки новизны, найденные проверяющими, в этой версии записей уже исправлены. Цифры — заявления источников, не независимо подтверждённые бизнес-эффекты; счётчик 125 проверенных случаев из прежнего корпуса не менялся. Связанные документы: Каталог практик и изменения, Индекс оригиналов и профиль мониторинга, Главный обзор E5, Свежая наука E5.