Atoms
Consejos y tutoriales

Accede a Recursos académicos

Artículos de investigación y recursos académicos detrás de las capacidades de múltiples agentes, razonamiento y flujo de trabajo de Atoms.

Atoms colabora con las principales universidades e institutos de investigación de todo el mundo, produciendo investigación de vanguardia sobre marcos de múltiples agentes, razonamiento de LLM, ampliación de contexto y flujos de trabajo automatizados.

Estos trabajos no solo impulsan el progreso teórico, sino que también fortalecen las capacidades de producto de Atoms en áreas como la colaboración entre múltiples agentes, la interpretación de datos, el razonamiento mejorado con RAG y la optimización de prompts.

1. No lo sabes hasta que haces clic: pruebas automatizadas de GUI para la evaluación de software listo para producción

Resumen

A medida que los modelos de lenguaje grandes (LLM) y los agentes de código evolucionan desde generar fragmentos aislados hasta crear aplicaciones completas con GUI, lógica interactiva y comportamientos dinámicos, los benchmarks actuales no logran evaluar eficazmente el software listo para producción. Las comprobaciones estáticas o los scripts binarios de aprobado/reprobado pasan por alto la usabilidad del mundo real, que solo surge mediante la interacción.

Para abordar esto, los autores presentan RealDevWorld, un marco de evaluación automatizado de extremo a extremo para probar la capacidad de los LLM de generar repositorios listos para producción desde cero.

Contribuciones clave

  • Primer marco de evaluación de extremo a extremo basado en GUI para aplicaciones listas para producción.

  • Presentó RealDevBench, un benchmark con 194 tareas de ingeniería multimodal diversas.

  • Propuso AppEvalPilot, un sistema de agente como juez que simula interacciones de usuario basadas en GUI para una evaluación integral.

  • Alcanzó una alta alineación humana (precisión 0.92, correlación 0.85) mientras reducía la dependencia de la revisión manual.

Leer más: https://arxiv.org/abs/2508.14104

2. Avances y desafíos en Foundation Agents: de la inteligencia inspirada en el cerebro a sistemas evolutivos, colaborativos y seguros

Resumen

La llegada de los LLM ha catalizado un cambio transformador en la IA, al permitir agentes inteligentes capaces de razonar, percibir y actuar en distintos dominios. Diseñar, evaluar y mejorar continuamente dichos agentes presenta desafíos multifacéticos.

Esta revisión ofrece una visión general integral de Foundation Agents, enmarcada a través de arquitecturas modulares inspiradas en el cerebro que integran conocimientos de la ciencia cognitiva, la neurociencia y la computación.

Contribuciones clave

  • Propone un marco modular que asigna componentes de agentes a funcionalidades cerebrales (memoria, modelado, metas, emociones).

  • Explora la auto-mejora y la adaptación continua mediante mecanismos evolutivos.

  • Examina los sistemas multiagente y la inteligencia colectiva emergente.

  • Aborda los desafíos de seguridad, robustez y alineación en el despliegue en el mundo real.

Leer más: https://arxiv.org/abs/2504.01990

3. Atom of Thoughts para el escalado en tiempo de prueba Markov de LLM

Resumen

Los LLM se benefician del escalado durante el entrenamiento, y el escalado en tiempo de prueba mejora aún más el razonamiento. Sin embargo, el contexto histórico acumulado puede desperdiciar cómputo y obstaculizar el razonamiento.

El artículo presenta Atom of Thoughts (AoT), que descompone el razonamiento complejo en subpreguntas atómicas y sin memoria, formando un proceso de razonamiento similar a Markov.

Contribuciones clave

  • Define el razonamiento atómico: descomponer preguntas en subproblemas DAG y contraerlos.

  • Ofrece compatibilidad como complemento para métodos existentes de escalado en tiempo de prueba.

  • Mejora la eficiencia al reducir la redundancia de contexto y el desperdicio computacional.

  • Demuestra ganancias significativas de rendimiento en seis benchmarks.

Leer más: https://arxiv.org/abs/2502.12018

4. Optimización autosupervisada de prompts (SPO)

Resumen

Los prompts de alta calidad son cruciales para mejorar el razonamiento de los LLM, pero el diseño manual de prompts requiere experiencia e iteración. Los métodos automatizados existentes dependen en gran medida de referencias etiquetadas, lo que limita su aplicabilidad en el mundo real.

SPO presenta un marco autosupervisado que descubre prompts eficaces tanto para tareas cerradas como abiertas sin referencias externas.

Contribuciones clave

  • Señales autosupervisadas derivadas exclusivamente de las salidas de los LLM.

  • Utiliza los LLM como evaluador y optimizador.

  • Logra un rendimiento de vanguardia con 1–5% del costo de los métodos tradicionales.

Leer más: https://arxiv.org/abs/2502.06855

5. Mejora de la fidelidad del contexto mediante Native Retrieval-Augmented Reasoning (CARE)

Resumen

Los LLM a menudo alucinan respuestas incompatibles con el contexto dado. Las soluciones tradicionales o bien requieren conjuntos de datos supervisados costosos o dependen de recuperación externa que aprovecha poco el contexto proporcionado por el usuario.

CARE presenta un marco de razonamiento nativo aumentado con recuperación en el que los LLM integran dinámicamente evidencia en contexto directamente en la cadena de razonamiento.

Contribuciones clave

  • Introduce la recuperación en contexto como parte del proceso de razonamiento.

  • Requiere una cantidad mínima de datos etiquetados y utiliza aprendizaje curricular para tareas complejas.

  • Supera a SFT, al RAG tradicional y a los métodos de recuperación externa en benchmarks de QA.

Leer más: https://openreview.net/forum?id=qTsU1QLOph

6. FACT: Examinando la efectividad de la reescritura iterativa de contexto para la recuperación de múltiples hechos

Resumen

Los modelos de lenguaje grandes (LLM) son eficaces para recuperar hechos individuales de contextos largos, pero tienen dificultades cuando deben recuperarse varios hechos simultáneamente. Una limitación clave observada es el fenómeno de “perdido en el medio”, donde los LLM pierden gradualmente el rastro de información importante durante la generación, lo que conduce a resultados incompletos o inexactos.

Para abordar esto, los autores proponen Find All Crucial Texts (FACT), un método iterativo de reescritura de contexto que refina progresivamente la entrada, permitiendo que el modelo capture hechos críticos paso a paso.

Contribuciones clave

  • Identifica y analiza el fenómeno de “perdido en el medio” en la recuperación de múltiples hechos.

  • Presenta FACT, un enfoque iterativo de recuperación y reescritura que mejora incrementalmente la cobertura factual.

  • Demuestra ganancias significativas de rendimiento en benchmarks de recuperación de múltiples hechos, aunque con mejoras menores en tareas generales de QA.

  • Destaca la necesidad de estrategias más robustas en la recuperación con contexto largo.

Leer más: https://arxiv.org/abs/2410.21012

7. SELA: agentes LLM mejorados con búsqueda en árboles para aprendizaje automático automatizado

Resumen

Los agentes de AutoML basados en LLM a menudo generan pipelines con poca diversidad y subóptimos. SELA aprovecha Monte Carlo Tree Search (MCTS) para optimizar la toma de decisiones del agente y la exploración de pipelines.

Contribuciones clave

  • Aplica métodos de búsqueda en árboles para mejorar la exploración en AutoML.

  • Refina iterativamente los pipelines con retroalimentación experimental.

  • Supera las líneas base tradicionales y basadas en agentes de AutoML en 20 conjuntos de datos.

Leer más: https://arxiv.org/abs/2410.17238

8. AFlow: automatización de la generación de flujos de trabajo agénticos

Resumen

Construir flujos de trabajo agénticos para LLM requiere mucho trabajo y no está totalmente automatizado. AFlow replantea la optimización de flujos de trabajo como un problema de búsqueda sobre grafos de código, usando MCTS para refinar iterativamente los flujos de trabajo con retroalimentación de ejecución.

Contribuciones clave

  • Define la optimización de flujos de trabajo como una búsqueda en grafos de código.

  • Permite que modelos más pequeños superen a GPT-4o a una fracción del costo.

  • Logra una mejora del 5.7% sobre las líneas base de última generación.

Leer más: https://arxiv.org/abs/2410.10762

9. Data Interpreter: un Agente LLM para ciencia de datos

Resumen

Los enfoques existentes tienen dificultades con los flujos de trabajo de ciencia de datos de extremo a extremo, las dependencias dinámicas entre tareas y los requisitos de experiencia en el dominio.

Data Interpreter presenta:

  • Modelado jerárquico de grafos: descompone problemas en subproblemas con nodos dinámicos.

  • Generación programable de nodos: refina y valida código iterativamente para lograr robustez.

Contribuciones clave

  • Primer Agente LLM adaptado a flujos de trabajo completos de ciencia de datos.

  • Logra una mejora del 25% en precisión en InfiAgent-DABench.

  • Mejora significativamente el aprendizaje automático, las tareas abiertas y el rendimiento en el conjunto de datos MATH.

Leer más: https://arxiv.org/abs/2402.18679

10. MetaGPT: Meta Programming para un marco colaborativo multiagente

Resumen

Los sistemas multiagente basados en LLM a menudo fallan en tareas complejas debido a alucinaciones en cascada. MetaGPT codifica procedimientos operativos estándar (SOP) en secuencias de prompts, agilizando flujos de trabajo y reduciendo errores.

Contribuciones clave

  • Introduce meta-programación para la colaboración multiagente.

  • Incorpora flujos de trabajo humanos basados en SOP en los prompts de agentes.

  • Permite una asignación eficiente de roles y descomposición de tareas.

  • Demuestra estabilidad y precisión superiores en tareas colaborativas de ingeniería de software.

Leer más: https://arxiv.org/abs/2308.00352

¿Te resultó útil esta página?

Artículos relacionados