Дополнительный материал
When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains
ID исходника: I2-SCI-0037. Слой: iteration2-v0.1.
Проекция исходной записи для навигации. Принятие исследовательского выпуска не подтверждает автоматически каждое утверждение. Каноническая запись — найти по ID.
Содержание и границы
Вывод работы: Агенты достигают соглашения в 98.9% переговоров и захватывают 95.4% первого по эффективности излишка в бездисконтированных условиях, но тратят в среднем 2.98 раунда против байесовского эталона в 1.25 раунда — эта задержка съедает 21-34% излишка в зависимости от терпеливости. Надёжность операций коррелирует со способностью модели: базовые модели принимают индивидуально невыгодные (иррациональные) контракты в 19.2% переговоров против 0.0-0.6% у моделей среднего и топового уровня — из чего авторы делают вывод, что автоматическая верификация прибыльности сделки обязательна ниже определённого порога возможностей модели. Идентичность провайдера предсказывает направление распределения выгоды сильнее, чем ранг возможностей: доля покупателя в самостоятельной игре в среднем 40% у OpenAI, 50% у Google и 70% у Alibaba Qwen — выбор вендора авторы называют решением первого порядка для распределения выгоды.
Объём чтения: full_text
transfer_limits: Авторы сами указывают три ограничения интерпретации (раздел 7): (1) промпты специфичны для роли, поэтому заявленные доли излишка отражают поведение при общей схеме промптирования, а не свободные от промпта оценки внутренней склонности к торгу; (2) параметры терпеливости каждой стороны раскрываются как общее знание обоим агентам, что соответствует информационной структуре байесовского эталона, но не типично для реальных переговоров, где терпеливость/срочность принципала не раскрывается контрагенту — не проверено; (3) ряд интерпретационных выводов остаётся описательным, а не механистически идентифицированным. Модель-специфичные результаты (конкретные доли излишка, ставки иррациональности, ранжирование провайдеров) авторы явно называют калиброванными под протестированные версии моделей и требующими периодической перекалибровки по мере обновления моделей провайдерами — в отличие от структурных закономерностей, которые, по их оценке, переносятся шире. Эксперимент не измеряет реальные закупочные результаты компаний (только симулированные переговоры LLM против LLM с эталоном теории игр).
Продолжение: Упомянутые во введении реальные внедрения (Walmart+Pactum, Arkestro/Globality/Fairmarkit, Alibaba Accio) — потенциальные кандидаты для карточек practice в других пакетах (P23 закупки/цепочки, не в этом пакете); в этой карточке они только контекст цитаты, отдельно не верифицировались.
Темы
Внешние материалы
Сохранённые оригиналы
Связаны по точному URL, а не по одному издателю.