Дополнительный материал
AI Agents for Inventory Control: Human-LLM-OR Complementarity
ID исходника: I2-SCI-0023. Слой: iteration2-v0.1.
Проекция исходной записи для навигации. Принятие исследовательского выпуска не подтверждает автоматически каждое утверждение. Каноническая запись — найти по ID.
Содержание и границы
Вывод работы: На бенчмарке InventoryBench (более 1000 инстансов) методы, сочетающие OR-алгоритмы и LLM, превзошли каждый метод по отдельности — авторы интерпретируют это как комплементарность, а не взаимозаменяемость OR и LLM. В контролируемом классном эксперименте с 69 участниками команды «человек+ИИ» (Mode B: OR→LLM→человек) в среднем достигли более высокой прибыли, чем люди или ИИ-агент по отдельности (популяционный эффект комплементарности положителен, односторонний bootstrap p=0.00010) — авторы явно противопоставляют это части прежней литературы о том, что человеко-ИИ сотрудничество в среднем работает хуже лучшего из человека или ИИ по отдельности (со ссылкой на мета-анализ Vaccaro et al., 2024, за пределами прочитанного текста этой работы). Индивидуальный эффект комплементарности неоднороден по инстансам (для части инстансов ИИ настолько эффективен, что до 70% участников в чистом человеческом режиме не превосходят его); авторы формализуют нижнюю границу доли людей, получающих положительный индивидуальный эффект от сотрудничества с ИИ, свободную от распределения. Дополнительно: сравнение двух режимов с поддержкой LLM показывает Mode B (человек следует/корректирует рекомендацию LLM) значимо лучше Mode C (LLM принимает решение автономно, человек даёт лишь стратегическое указание): оценённый эффект τ̂C − τ̂B = −0.0722 (SE=0.0177, двусторонний p=0.00012); нормированная награда Mode C = 0.464 против OR→LLM (автоматический режим) = 0.538. Авторы делают вывод, что в их эксперименте LLM эффективнее как инструмент поддержки решения, который человек может выборочно принимать, корректировать или отклонять, чем как основной контроллер с редким участием человека — но прямо оговаривают, что это сравнение зависит от технологии и интерфейса (более сильные модели или лучшие механизмы перевода намерения человека в действия могут сократить или обратить этот разрыв). Индивидуальный эффект комплементарности значим только на инстансе 1 (Ei[CEi]=0.048, 95% ДИ [0.004, 0.091]); на инстансах 2 и 3 эффект статистически не значим (на инстансе 2 70% участников чистого человеческого режима A не превосходят ИИ-бенчмарк — это результат по одному инстансу, а не по выборке в целом). Популяционный эффект комплементарности CE=0.0496, что в относительном выражении ≈ 10.2% прироста к лучшему базовому результату (человека или ИИ по отдельности).
Объём чтения: full_text
transfer_limits: Классный эксперимент проведён на упрощённой веб-игре по управлению запасами, а не в реальной ERP/SCM-системе действующей компании; статус участников (студенты/практики) не уточнён в прочитанной части текста — если это студенты, перенос эффекта прибыли на профессиональных операционных менеджеров не показан; выборка 69 человек и 187 наблюдений небольшая; вывод о превосходстве человеко-ИИ команд относится к конкретной задаче и конкретному режиму передачи рекомендаций (OR→LLM→человек), не ко всем формам человеко-ИИ сотрудничества. Авторы: Jackie Baek (Stern School of Business, NYU), Yaopeng Fu, Will Ma, Tianyi Peng (Columbia University / Columbia Business School, Graduate School of Business and Data Science Institute); исследование поддержано Columbia AI Agents Initiative при Columbia Business School — коммерческой заинтересованности в конкретном вендоре ИИ не выявлено. Классный эксперимент предрегистрирован (https://aspredicted.org/gs5tm3.pdf). Результат Mode B > Mode C сам по себе технология- и интерфейс-зависим (оговорка авторов); вывод «до 70% участников не превосходят ИИ» относится только к инстансу 2, а не ко всей выборке.
Продолжение: Уточнить статус участников классного эксперимента (студенты/практики) при появлении бюджета на более полное чтение; мониторить рецензируемую публикацию.
Темы
Внешние материалы
Сохранённые оригиналы
Связаны по точному URL, а не по одному издателю.