Дополнительный материал
Agentic ERP: Multi-Agent Large Language Model Architecture for Autonomous Enterprise Resource Planning
ID исходника: I2-SCI-0033. Слой: iteration2-v0.1.
Проекция исходной записи для навигации. Принятие исследовательского выпуска не подтверждает автоматически каждое утверждение. Каноническая запись — найти по ID.
Содержание и границы
Вывод работы: На 365-дневной симуляции предложенная мультиагентная архитектура (с человеко-контролируемым risk-tiered harness) удерживала нулевое число дефицитов запасов (stockouts) при стохастическом спросе/предложении, тогда как rule-based RPA-базовая линия накопила сотни дефицитов за тот же период; чистая прибыль симуляции — $2 240 685 против низкой базовой линии, рост денежной позиции — 237% (сравнение по кассовой позиции/выручке). На кросс-функциональном кризисном бенчмарке предложенная оркестрация статистически неотличима от сильнейших мультиагентных базовых линий и значимо лучше однопроходного (single-step) рассуждения — по мнению авторов, решающий фактор — рефлексивная мультиагентная структура, а не конкретный фреймворк.
Объём чтения: full_text
transfer_limits: Авторы сами перечисляют границы переноса (Section 6, дословно): метрика завершения задачи путает корректность выполненного действия Odoo с бизнес-уместностью ответа; качество ответа на кризисном бенчмарке оценивается LLM-судьёй — автоматическим прокси, не калиброванным по человеческим оценкам; "all evaluation data are synthetic and every reported score is produced automatically"; статистика опирается на одиночные прогоны (single-seed) и подвыборку стабильности из 10 сценариев; заявленная стоимость исключает труд на разработку, надзор и комплаенс ("reported cost excludes development, oversight, and compliance labour"); обобщение ограничено единственной смоделированной SME ("tea-trading"), второй фикстур не прогонялся эмпирически; 365-дневная симуляция не может отразить состязательную или репутационную динамику; тестовый бенчмарк E2 не является репрезентативной рабочей нагрузкой; система зависит от хостируемой LLM, чьи цена и поведение могут меняться. Авторы прямо пишут: обобщение на регулируемые отрасли, промышленные объёмы транзакций и живое внедрение (live deployment) остаётся будущей работой.
Продолжение: Мониторить: не появится ли эмпирическая проверка на промышленных объёмах или в регулируемых отраслях (авторы сами называют это будущей работой).
Темы
Внешние материалы
Сохранённые оригиналы
Связаны по точному URL, а не по одному издателю.