Документ сопоставляет проверенные исследования с архитектурой metis. Утверждения относятся к бенчмаркам, если не указано иное; в продакшене поведение может отличаться.
Полная англоязычная версия: RESEARCH.md (en)
| Работа | Площадка / год | Что реально показано | Связь с metis |
|---|---|---|---|
| Agent Scaling via Diversity | arXiv 2026 | Насыщение при однородном масштабировании; 2 разнообразных агента ≈ 16 однородных на 7 бенчмарках | min_unique_council_models: 2, гетерогенный кластер |
| MoA | ICLR 2025 Spotlight | Слоистый MoA: 65,1% на AlpacaEval 2.0 vs 57,5% GPT-4o (open-модели) | Слоистый MoA в коде |
| Self-MoA | arXiv 2025 | Одна сильная модель + сэмплы часто лучше гетерогенного MoA | Гетерогенность не всегда выигрывает |
| When Agents Disagree | arXiv 2026 | Разнообразие помогает при судье; синтез MoA может проигрывать одной модели | Верификатор + retry |
| MMAD | OpenReview | Наивный дебат на SLM 3–8B → дрейф, до ~10% точности | Параллельный совет, не дебат |
| CONSENSAGENT | ACL Findings 2025 | Сикофантия в MAD замедляет консенсус | Структурированные промпты |
| Peacemaker or Troublemaker | arXiv 2025 | Сикофантия рушит дебат, хуже single-agent | Red-team, скептик |
Цитата: Yingxuan Yang et al. Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity. arXiv:2602.03794, 2026. PDF · OpenReview
Доказано:
- Масштабирование однородных агентов даёт убывающую отдачу на семи бенчмарках (GSM8K, ARC, Formal Logic, TruthfulQA, HellaSwag, WinoGrande, Pro Medicine).
- Гетерогенность (модели, персоны, промпты) даёт дополняющие каналы; метрика K*.
- При Vote/Debate и моделях 7–8B: 2 агента L4 (полное разнообразие) ≥ 16 агентов L1 (без разнообразия) в отчётных настройках.
- Сильнее на многошаговом рассуждении, слабее на фактологических задачах.
Оговорки: только 7–8B open-модели; vote/debate, не слоистый MoA; бенчмарки, не продакшен.
Принято в metis: ≥2 разных модели при enforce_heterogeneous_agents: true.
Экстраполяция: что 5 ролей совета с 2–3 моделями «достаточно» — не проверено напрямую.
Цитата: Junlin Wang et al. Mixture-of-Agents Enhances Large Language Model Capabilities. ICLR 2025 (Spotlight). arXiv:2406.04692. Статья ICLR
Доказано:
- Слоистый MoA: proposer → aggregator по слоям.
- 65,1% LC win rate на AlpacaEval 2.0 vs 57,5% GPT-4 Omni только на open-моделях.
Оговорки: качество инструкций/чата; не агенты с инструментами; выше стоимость.
Принято: propose → refine → aggregate в moa.py.
Цитата: Wenzhe Li et al. arXiv:2502.00674, 2025. PDF
Доказано: Self-MoA (одна топ-модель) часто лучше гетерогенного MoA (+6,6 п.п. AlpacaEval 2.0; ~+3,8% в среднем на MMLU, CRUX, MATH). Смешивание слабых моделей снижает качество.
Принято: гетерогенность — вероятный, не гарантированный выигрыш; температура на одной модели — слабое разнообразие.
Цитата: When Agents Disagree. arXiv:2603.20324, 2026. PDF
Доказано (42 задачи): разнообразная команда + судья → WR 0,810; MoA-синтез проиграл baseline в 0/42 задач по панели судей.
Принято: отдельный верификатор, не только синтез.
Цитата: MMAD: Multi-Agent Mutual Awareness Debate. OpenReview (площадка TBD)
Сообщают: наивный дебат на SLM 3–8B → сикофантический дрейф, точность до ~10%; MMAD (MToM) восстанавливает GSM8K, CodeQA и др.
Оговорки: многораундовый дебат; metis использует параллельный совет без взаимного просмотра на этапе интерпретации.
Принято: не делать наивный дебат на малых моделях; confidence gate.
Цитата: Priya Pitre et al. ACL Findings 2025. DOI
Сикофантия в MAD увеличивает стоимость; оптимизация промптов помогает.
Цитата: Binwei Yao et al. arXiv:2509.23055. PDF
Избыточная уступчивость в дебате → коллапс, иногда хуже single-agent.
| Утверждение metis | Поддержка | Уверенность |
|---|---|---|
| ≥2 гетерогенные модели | Agent Scaling, MoA | Вероятно |
| Слоистый MoA | ICLR 2025 MoA | Доказано на chat-бенчмарках |
| Параллельный совет | Снижает риск дрейфа дебата | Правдоподобно |
| Верификатор + retry | Selection bottleneck | Вероятно |
| Больше однородных агентов ≠ линейный рост | Agent Scaling | Доказано (7 бенчмарков, 7–8B) |
| Гетерогенный MoA всегда лучше | Опровергается Self-MoA | Зависит от задачи и качества моделей |
См. английскую версию.