Skip to content

Latest commit

 

History

History
116 lines (68 loc) · 7.81 KB

File metadata and controls

116 lines (68 loc) · 7.81 KB

Научный обзор — гетерогенные мультиагентные LLM-системы

Документ сопоставляет проверенные исследования с архитектурой metis. Утверждения относятся к бенчмаркам, если не указано иное; в продакшене поведение может отличаться.

Полная англоязычная версия: RESEARCH.md (en)

Сводная таблица

Работа Площадка / год Что реально показано Связь с metis
Agent Scaling via Diversity arXiv 2026 Насыщение при однородном масштабировании; 2 разнообразных агента ≈ 16 однородных на 7 бенчмарках min_unique_council_models: 2, гетерогенный кластер
MoA ICLR 2025 Spotlight Слоистый MoA: 65,1% на AlpacaEval 2.0 vs 57,5% GPT-4o (open-модели) Слоистый MoA в коде
Self-MoA arXiv 2025 Одна сильная модель + сэмплы часто лучше гетерогенного MoA Гетерогенность не всегда выигрывает
When Agents Disagree arXiv 2026 Разнообразие помогает при судье; синтез MoA может проигрывать одной модели Верификатор + retry
MMAD OpenReview Наивный дебат на SLM 3–8B → дрейф, до ~10% точности Параллельный совет, не дебат
CONSENSAGENT ACL Findings 2025 Сикофантия в MAD замедляет консенсус Структурированные промпты
Peacemaker or Troublemaker arXiv 2025 Сикофантия рушит дебат, хуже single-agent Red-team, скептик

1. Масштабирование агентов через разнообразие

Цитата: Yingxuan Yang et al. Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity. arXiv:2602.03794, 2026. PDF · OpenReview

Доказано:

  • Масштабирование однородных агентов даёт убывающую отдачу на семи бенчмарках (GSM8K, ARC, Formal Logic, TruthfulQA, HellaSwag, WinoGrande, Pro Medicine).
  • Гетерогенность (модели, персоны, промпты) даёт дополняющие каналы; метрика K*.
  • При Vote/Debate и моделях 7–8B: 2 агента L4 (полное разнообразие) ≥ 16 агентов L1 (без разнообразия) в отчётных настройках.
  • Сильнее на многошаговом рассуждении, слабее на фактологических задачах.

Оговорки: только 7–8B open-модели; vote/debate, не слоистый MoA; бенчмарки, не продакшен.

Принято в metis: ≥2 разных модели при enforce_heterogeneous_agents: true.

Экстраполяция: что 5 ролей совета с 2–3 моделями «достаточно» — не проверено напрямую.


2. Mixture-of-Agents (MoA)

Цитата: Junlin Wang et al. Mixture-of-Agents Enhances Large Language Model Capabilities. ICLR 2025 (Spotlight). arXiv:2406.04692. Статья ICLR

Доказано:

  • Слоистый MoA: proposer → aggregator по слоям.
  • 65,1% LC win rate на AlpacaEval 2.0 vs 57,5% GPT-4 Omni только на open-моделях.

Оговорки: качество инструкций/чата; не агенты с инструментами; выше стоимость.

Принято: propose → refine → aggregate в moa.py.


3. Self-MoA (контраргумент)

Цитата: Wenzhe Li et al. arXiv:2502.00674, 2025. PDF

Доказано: Self-MoA (одна топ-модель) часто лучше гетерогенного MoA (+6,6 п.п. AlpacaEval 2.0; ~+3,8% в среднем на MMLU, CRUX, MATH). Смешивание слабых моделей снижает качество.

Принято: гетерогенность — вероятный, не гарантированный выигрыш; температура на одной модели — слабое разнообразие.


4. Узкое место отбора

Цитата: When Agents Disagree. arXiv:2603.20324, 2026. PDF

Доказано (42 задачи): разнообразная команда + судья → WR 0,810; MoA-синтез проиграл baseline в 0/42 задач по панели судей.

Принято: отдельный верификатор, не только синтез.


5. MMAD (сикофантический дрейф)

Цитата: MMAD: Multi-Agent Mutual Awareness Debate. OpenReview (площадка TBD)

Сообщают: наивный дебат на SLM 3–8B → сикофантический дрейф, точность до ~10%; MMAD (MToM) восстанавливает GSM8K, CodeQA и др.

Оговорки: многораундовый дебат; metis использует параллельный совет без взаимного просмотра на этапе интерпретации.

Принято: не делать наивный дебат на малых моделях; confidence gate.


6. CONSENSAGENT

Цитата: Priya Pitre et al. ACL Findings 2025. DOI

Сикофантия в MAD увеличивает стоимость; оптимизация промптов помогает.


7. Peacemaker or Troublemaker

Цитата: Binwei Yao et al. arXiv:2509.23055. PDF

Избыточная уступчивость в дебате → коллапс, иногда хуже single-agent.


Сопоставление с архитектурой

Утверждение metis Поддержка Уверенность
≥2 гетерогенные модели Agent Scaling, MoA Вероятно
Слоистый MoA ICLR 2025 MoA Доказано на chat-бенчмарках
Параллельный совет Снижает риск дрейфа дебата Правдоподобно
Верификатор + retry Selection bottleneck Вероятно
Больше однородных агентов ≠ линейный рост Agent Scaling Доказано (7 бенчмарков, 7–8B)
Гетерогенный MoA всегда лучше Опровергается Self-MoA Зависит от задачи и качества моделей

Библиография

См. английскую версию.