Este documento relaciona investigación verificada con el diseño de metis. Las afirmaciones son específicas de benchmarks salvo que se indique lo contrario.
Versión completa en inglés: RESEARCH.md (en)
| Artículo | Venue / año | Qué demostró realmente | Relevancia para metis |
|---|---|---|---|
| Agent Scaling via Diversity | arXiv 2026 | Rendimientos decrecientes homogéneos; 2 agentes diversos ≈ 16 homogéneos en 7 benchmarks | min_unique_council_models: 2 |
| MoA | ICLR 2025 Spotlight | MoA en capas: 65,1% AlpacaEval 2.0 vs 57,5% GPT-4o | Pipeline MoA en capas |
| Self-MoA | arXiv 2025 | Un solo modelo fuerte a menudo supera MoA heterogéneo | La diversidad no siempre gana |
| When Agents Disagree | arXiv 2026 | Diversidad ayuda con juez; síntesis MoA puede perder vs un modelo | Verificador + reintento |
| MMAD | OpenReview | Debate ingenuo en SLM 3–8B → deriva, hasta ~10% precisión | Consejo paralelo, no debate |
| CONSENSAGENT | ACL Findings 2025 | Sicofancia en MAD aumenta coste | Prompts estructurados |
| Peacemaker or Troublemaker | arXiv 2025 | Sicofancia colapsa el debate | Rol escéptico, red-team |
Cita: Yingxuan Yang et al. Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity. arXiv:2602.03794, 2026. PDF · OpenReview
Demostrado:
- Escalar agentes homogéneos muestra rendimientos decrecientes en siete benchmarks.
- La heterogeneidad aporta evidencia complementaria; métrica K*.
- Con Vote/Debate y modelos 7–8B: 2 agentes L4 ≥ 16 agentes L1 en configuraciones reportadas.
- Más fuerte en razonamiento multi-paso que en recuperación factual.
Salvedades: solo modelos open 7–8B; vote/debate, no MoA en capas; benchmarks, no producción.
Adoptado: ≥2 modelos distintos con enforce_heterogeneous_agents: true.
Extrapolado: que 5 roles del consejo bastan — no probado directamente.
Cita: Junlin Wang et al. ICLR 2025 (Spotlight). arXiv:2406.04692. Paper ICLR
Demostrado: MoA en capas con solo modelos open alcanza 65,1% LC win rate en AlpacaEval 2.0 vs 57,5% GPT-4 Omni.
Salvedades: benchmarks de instrucciones/chat; mayor coste y latencia.
Adoptado: proponer → refinar → agregar en moa.py.
Cita: Wenzhe Li et al. arXiv:2502.00674, 2025. PDF
Demostrado: Self-MoA supera MoA heterogéneo en muchos escenarios (+6,6 pp AlpacaEval 2.0).
Adoptado: diversidad probable, no garantizada; temperatura en un solo modelo es diversidad débil.
Cita: When Agents Disagree. arXiv:2603.20324, 2026. PDF
Demostrado (42 tareas): equipo diverso + juez → WR 0,810; síntesis estilo MoA perdió vs baseline en 0/42 tareas según el panel de jueces.
Adoptado: verificador separado, no solo síntesis.
Cita: MMAD: Multi-Agent Mutual Awareness Debate. OpenReview
Reportan: debate ingenuo en SLM 3–8B causa deriva sicofántica (hasta ~10% precisión); MMAD (MToM) mitiga en GSM8K, CodeQA, etc.
Salvedades: debate multi-ronda; metis usa consejo paralelo sin ver respuestas ajenas en interpretación.
Ver versión en inglés para detalles. Resumen: la sicofancia en debate multiagente degrada resultados; prompts estructurados y roles críticos ayudan.
| Afirmación metis | Evidencia | Confianza |
|---|---|---|
| ≥2 modelos heterogéneos | Agent Scaling, MoA | Probable |
| MoA en capas | ICLR 2025 | Demostrado en benchmarks chat |
| Consejo paralelo | Reduce riesgo de deriva de debate | Plausible |
| Verificador + reintento | Selection bottleneck | Probable |
| Más agentes homogéneos ≠ ganancia lineal | Agent Scaling | Demostrado (7 benchmarks, 7–8B) |
| MoA heterogéneo siempre mejor | Contradicho por Self-MoA | Depende de tarea y calidad |
Ver RESEARCH.md (en).