Дополнительный материал
Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows
ID исходника: I2-SCI-0022. Слой: iteration2-v0.1.
Проекция исходной записи для навигации. Принятие исследовательского выпуска не подтверждает автоматически каждое утверждение. Каноническая запись — найти по ID.
Содержание и границы
Вывод работы: Авторы представляют EntCollabBench — бенчмарк мультиагентного сотрудничества в симулированной организации с разграничением прав доступа (11 ролевых агентов, шесть отделов), с двумя подмножествами задач: Workflow (совместное изменение состояний корпоративных систем) и Approval (решения, основанные на политиках). Оценка ведётся по трассам выполнения, проверке состояния базы данных и детерминированному арбитражу политик, а не по оценке текстового ответа судьёй. Эксперименты с современными LLM-агентами показывают, что модели заметно хуже справляются со сквозным корпоративным сотрудничеством, особенно с делегированием задач, переносом контекста между агентами, параметризацией и фиксацией итогового решения (workflow closure, decision commitment).
Объём чтения: abstract_only
transfer_limits: Полностью симулированная организация и синтетические задачи; результаты касаются возможностей текущих LLM-агентов на конкретном бенчмарке, а не производительности внедрённой практики в реальной компании; прочитана только аннотация (abstract_only), точные числовые показатели (accuracy/успешность по подмножествам) не извлечены из полного текста.
Продолжение: При появлении бюджета прочитать полный текст (45 стр.) для точных числовых показателей по подмножествам Workflow/Approval.
Темы
Операционная модель · Экономика и труд · Агентная экономика и инфраструктура
Внешние материалы
Сохранённые оригиналы
Связаны по точному URL, а не по одному издателю.