Accéder aux Ressources académiques
Articles de recherche et ressources académiques derrière les capacités multi-agent, de raisonnement et de workflow d’Atoms.
Atoms collabore avec les meilleures universités et instituts de recherche du monde entier, produisant des recherches de pointe sur les frameworks multi-agent, le raisonnement des LLM, l’augmentation du contexte et les workflows automatisés.
Ces travaux ne font pas seulement progresser la théorie, ils renforcent également les capacités produit d’Atoms dans des domaines tels que la collaboration multi-agent, l’interprétation des données, le raisonnement amélioré par le RAG et l’optimisation des prompts.
1. Vous ne savez pas avant de cliquer : tests automatisés d’interface graphique pour l’évaluation de logiciels prêts pour la production
Résumé
À mesure que les grands modèles de langage (LLMs) et les agents de code évoluent, passant de la génération d’extraits isolés à la création d’applications complètes avec interfaces graphiques, logique interactive et comportements dynamiques, les benchmarks actuels ne parviennent pas à évaluer efficacement des logiciels prêts pour la production. Les vérifications statiques ou les scripts binaires de réussite/échec négligent l’utilisabilité dans le monde réel, qui n’émerge qu’à travers l’interaction.
Pour répondre à cela, les auteurs présentent RealDevWorld, un framework d’évaluation automatisée de bout en bout pour tester la capacité des LLM à générer des dépôts prêts pour la production à partir de zéro.
Contributions clés
Premier framework d’évaluation de bout en bout basé sur une interface graphique pour des applications prêtes pour la production.
Présentation de RealDevBench, un benchmark comportant 194 tâches d’ingénierie multimodales variées.
Proposition de AppEvalPilot, un système d’agent-jugé qui simule des interactions utilisateur basées sur une interface graphique pour une évaluation holistique.
Obtention d’un fort alignement avec l’humain (précision 0.92, corrélation 0.85) tout en réduisant la dépendance à la revue manuelle.
En savoir plus : https://arxiv.org/abs/2508.14104
2. Avancées et défis des Foundation Agents : de l’intelligence inspirée du cerveau aux systèmes évolutifs, collaboratifs et sûrs
Résumé
L’avènement des LLM a catalysé une transformation majeure de l’IA, en permettant des agents intelligents capables de raisonnement, de perception et d’action dans différents domaines. Concevoir, évaluer et améliorer continuellement de tels agents présente des défis multiples.
Cette étude offre une vue d’ensemble complète des Foundation Agents, présentés à travers des architectures modulaires inspirées du cerveau qui intègrent des enseignements issus des sciences cognitives, des neurosciences et du calcul.
Contributions clés
Propose un framework modulaire mettant en correspondance les composants d’agent avec les fonctions du cerveau (mémoire, modélisation, objectifs, émotions).
Explore l’auto-amélioration et l’adaptation continue au moyen de mécanismes évolutifs.
Examine les systèmes multi-agent et l’intelligence collective émergente.
Traite des défis liés à la sécurité, à la robustesse et à l’alignement dans les déploiements réels.
En savoir plus : https://arxiv.org/abs/2504.01990
3. Atom of Thoughts pour la mise à l’échelle au moment du test des LLM de Markov
Résumé
Les LLM tirent profit de la mise à l’échelle pendant l’entraînement, et la mise à l’échelle au moment du test améliore encore davantage le raisonnement. Cependant, l’accumulation du contexte historique peut gaspiller des ressources de calcul et nuire au raisonnement.
L’article présente Atom of Thoughts (AoT), qui décompose le raisonnement complexe en sous-questions atomiques sans mémoire, formant un processus de raisonnement de type markovien.
Contributions clés
Définit le raisonnement atomique : décomposer les questions en sous-problèmes DAG puis les contracter.
Offre une compatibilité sous forme de plug-in pour les méthodes existantes de mise à l’échelle au moment du test.
Améliore l’efficacité en réduisant la redondance du contexte et le gaspillage computationnel.
Démontre des gains de performance significatifs sur six benchmarks.
En savoir plus : https://arxiv.org/abs/2502.12018
4. Optimisation auto-supervisée des prompts (SPO)
Résumé
Des prompts de haute qualité sont essentiels pour améliorer le raisonnement des LLM, mais la conception manuelle de prompts demande de l’expertise et des itérations. Les méthodes automatisées existantes reposent fortement sur des références annotées, ce qui limite leur applicabilité dans le monde réel.
SPO introduit un framework auto-supervisé qui découvre des prompts efficaces pour les tâches à réponse fermée comme ouverte, sans références externes.
Contributions clés
Signaux auto-supervisés dérivés uniquement des sorties des LLM.
Utilise les LLM à la fois comme évaluateur et comme optimiseur.
Atteint des performances de pointe avec 1–5% du coût des méthodes traditionnelles.
En savoir plus : https://arxiv.org/abs/2502.06855
5. Amélioration de la fidélité au contexte via le raisonnement natif augmenté par récupération (CARE)
Résumé
Les LLM hallucinent souvent des réponses incohérentes avec le contexte donné. Les solutions traditionnelles exigent soit des jeux de données supervisés coûteux, soit un système de récupération externe qui sous-utilise le contexte fourni par l’utilisateur.
CARE introduit un framework de raisonnement natif augmenté par récupération dans lequel les LLM intègrent dynamiquement les éléments de preuve en contexte directement dans la chaîne de raisonnement.
Contributions clés
Introduit la récupération en contexte comme partie intégrante du processus de raisonnement.
Nécessite un minimum de données annotées et utilise l’apprentissage par curriculum pour les tâches complexes.
Surpasse les méthodes SFT, RAG traditionnelles et de récupération externe sur des benchmarks de questions-réponses.
En savoir plus : https://openreview.net/forum?id=qTsU1QLOph
6. FACT : examen de l’efficacité de la réécriture itérative du contexte pour la récupération de faits multiples
Résumé
Les grands modèles de langage (LLMs) sont performants pour récupérer des faits uniques à partir de contextes longs, mais rencontrent des difficultés lorsque plusieurs faits doivent être récupérés simultanément. Une limite majeure observée est le « phénomène de perte au milieu », dans lequel les LLM perdent progressivement la trace d’informations importantes pendant la génération, ce qui conduit à des sorties incomplètes ou inexactes.
Pour remédier à cela, les auteurs proposent Find All Crucial Texts (FACT) — une méthode itérative de réécriture du contexte qui affine progressivement l’entrée, permettant au modèle de capturer les faits critiques étape par étape.
Contributions clés
Identifie et analyse le « phénomène de perte au milieu » dans la récupération de faits multiples.
Introduit FACT, une approche itérative de récupération et de réécriture qui améliore progressivement la couverture factuelle.
Démontre des gains de performance significatifs sur des benchmarks de récupération de faits multiples, bien qu’avec des améliorations plus modestes sur des tâches générales de questions-réponses.
Souligne la nécessité de stratégies plus robustes pour la récupération en contexte long.
En savoir plus : https://arxiv.org/abs/2410.21012
7. SELA : agents LLM améliorés par recherche arborescente pour le machine learning automatisé
Résumé
Les agents AutoML basés sur des LLM génèrent souvent des pipelines peu diversifiés et sous-optimaux. SELA s’appuie sur la recherche arborescente de Monte Carlo (MCTS) pour optimiser la prise de décision des agents et l’exploration des pipelines.
Contributions clés
Applique des méthodes de recherche arborescente pour améliorer l’exploration AutoML.
Affine les pipelines de manière itérative grâce à des retours expérimentaux.
Surpasse les références AutoML traditionnelles et basées sur des agents sur 20 jeux de données.
En savoir plus : https://arxiv.org/abs/2410.17238
8. AFlow : automatiser la génération de workflows agentiques
Résumé
La construction de workflows agentiques pour les LLM demande beaucoup de travail et n’est pas entièrement automatisée. AFlow reformule l’optimisation des workflows comme un problème de recherche sur des graphes de code, en utilisant MCTS pour affiner les workflows de manière itérative avec un retour d’exécution.
Contributions clés
Définit l’optimisation des workflows comme une recherche sur un graphe de code.
Permet à des modèles plus petits de surpasser GPT-4o pour une fraction du coût.
Obtient une amélioration de 5.7% par rapport aux références de pointe.
En savoir plus : https://arxiv.org/abs/2410.10762
9. Data Interpreter : un agent LLM pour la data science
Résumé
Les approches existantes ont du mal à gérer les workflows complets de data science, les dépendances dynamiques entre tâches et les exigences d’expertise métier.
Data Interpreter introduit :
Modélisation de graphe hiérarchique : décompose les problèmes en sous-problèmes avec des nœuds dynamiques.
Génération de nœuds programmable : affine et valide le code de manière itérative pour plus de robustesse.
Contributions clés
Premier agent LLM conçu pour des workflows complets de data science.
Atteint une amélioration de précision de 25% sur InfiAgent-DABench.
Améliore significativement les performances en machine learning, sur les tâches ouvertes et sur le jeu de données MATH.
En savoir plus : https://arxiv.org/abs/2402.18679
10. MetaGPT : métaprogrammation pour un framework collaboratif multi-agent
Résumé
Les systèmes multi-agent basés sur des LLM échouent souvent sur les tâches complexes en raison d’hallucinations en cascade. MetaGPT encode des procédures opératoires standard (SOP) dans des séquences de prompts, rationalisant les workflows et réduisant les erreurs.
Contributions clés
Introduit la métaprogrammation pour la collaboration multi-agent.
Intègre des workflows humains basés sur des SOP dans les prompts des agents.
Permet une attribution efficace des rôles et la décomposition des tâches.
Démontre une stabilité et une précision supérieures dans les tâches collaboratives d’ingénierie logicielle.
En savoir plus : https://arxiv.org/abs/2308.00352