AI Native
БиблиотекаПриложение

Дополнительный материал

Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows

ID исходника: I2-SCI-0022. Слой: iteration2-v0.1.

Проекция исходной записи для навигации. Принятие исследовательского выпуска не подтверждает автоматически каждое утверждение. Каноническая запись — найти по ID.

Содержание и границы

Вывод работы: Авторы представляют EntCollabBench — бенчмарк мультиагентного сотрудничества в симулированной организации с разграничением прав доступа (11 ролевых агентов, шесть отделов), с двумя подмножествами задач: Workflow (совместное изменение состояний корпоративных систем) и Approval (решения, основанные на политиках). Оценка ведётся по трассам выполнения, проверке состояния базы данных и детерминированному арбитражу политик, а не по оценке текстового ответа судьёй. Эксперименты с современными LLM-агентами показывают, что модели заметно хуже справляются со сквозным корпоративным сотрудничеством, особенно с делегированием задач, переносом контекста между агентами, параметризацией и фиксацией итогового решения (workflow closure, decision commitment).

Объём чтения: abstract_only

transfer_limits: Полностью симулированная организация и синтетические задачи; результаты касаются возможностей текущих LLM-агентов на конкретном бенчмарке, а не производительности внедрённой практики в реальной компании; прочитана только аннотация (abstract_only), точные числовые показатели (accuracy/успешность по подмножествам) не извлечены из полного текста.

Продолжение: При появлении бюджета прочитать полный текст (45 стр.) для точных числовых показателей по подмножествам Workflow/Approval.

Темы

Операционная модель · Экономика и труд · Агентная экономика и инфраструктура

Внешние материалы

Сохранённые оригиналы

Связаны по точному URL, а не по одному издателю.

Каталог этого слоя и типа · Главная карта