Acesse Recursos Acadêmicos
Artigos de pesquisa e recursos acadêmicos por trás das capacidades de múltiplos agentes, raciocínio e fluxo de trabalho da Atoms.
A Atoms colabora com as principais universidades e institutos de pesquisa do mundo, produzindo pesquisas de ponta sobre frameworks de múltiplos agentes, raciocínio com LLM, aumento de contexto e fluxos de trabalho automatizados.
Esses trabalhos não apenas impulsionam o progresso teórico, mas também fortalecem as capacidades dos produtos da Atoms em áreas como colaboração entre múltiplos agentes, interpretação de dados, raciocínio aprimorado por RAG e otimização de prompt.
1. Você Não Sabe Até Clicar: Testes Automatizados de GUI para Avaliação de Software Pronto para Produção
Resumo
À medida que grandes modelos de linguagem (LLMs) e agentes de código evoluem de gerar trechos isolados para construir aplicações completas com GUIs, lógica interativa e comportamentos dinâmicos, os benchmarks atuais falham em avaliar com eficácia software pronto para produção. Verificações estáticas ou scripts binários de aprovação/reprovação ignoram a usabilidade no mundo real, que só emerge por meio da interação.
Para abordar isso, os autores apresentam o RealDevWorld, um framework de avaliação automatizada de ponta a ponta para testar a capacidade dos LLMs de gerar repositórios prontos para produção do zero.
Principais Contribuições
Primeiro framework de avaliação de ponta a ponta baseado em GUI para aplicações prontas para produção.
Introduziu o RealDevBench, um benchmark com 194 tarefas de engenharia multimodais diversas.
Propôs o AppEvalPilot, um sistema de agente-como-juiz que simula interações de usuários baseadas em GUI para uma avaliação holística.
Alcançou alta alinhamento com humanos (acurácia de 0,92, correlação de 0,85) ao mesmo tempo em que reduziu a dependência de revisão manual.
Leia mais: https://arxiv.org/abs/2508.14104
2. Avanços e Desafios em Foundation Agents: Da Inteligência Inspirada no Cérebro a Sistemas Evolutivos, Colaborativos e Seguros
Resumo
O advento dos LLMs catalisou uma mudança transformadora na IA, possibilitando agentes inteligentes capazes de raciocínio, percepção e ação em diferentes domínios. Projetar, avaliar e melhorar continuamente esses agentes apresenta desafios multifacetados.
Este levantamento fornece uma visão abrangente de Foundation Agents, estruturada por meio de arquiteturas modulares inspiradas no cérebro que integram insights da ciência cognitiva, neurociência e computação.
Principais Contribuições
Propõe um framework modular que mapeia componentes de agentes para funcionalidades do cérebro (memória, modelagem, objetivos, emoções).
Explora autoaperfeiçoamento e adaptação contínua por meio de mecanismos evolutivos.
Examina sistemas de múltiplos agentes e inteligência coletiva emergente.
Aborda desafios de segurança, robustez e alinhamento na implementação no mundo real.
Leia mais: https://arxiv.org/abs/2504.01990
3. Atom of Thoughts para Escalonamento em Tempo de Teste de LLM Markoviano
Resumo
Os LLMs se beneficiam de escalonamento durante o treinamento, e o escalonamento em tempo de teste aprimora ainda mais o raciocínio. No entanto, o contexto histórico acumulado pode desperdiçar computação e dificultar o raciocínio.
O artigo apresenta o Atom of Thoughts (AoT), que decompõe raciocínios complexos em subquestões atômicas e sem memória, formando um processo de raciocínio semelhante a Markov.
Principais Contribuições
Define raciocínio atômico: decompor questões em subproblemas DAG e contraí-los.
Oferece compatibilidade como plug-in para métodos existentes de escalonamento em tempo de teste.
Melhora a eficiência ao reduzir redundância de contexto e desperdício computacional.
Demonstra ganhos significativos de desempenho em seis benchmarks.
Leia mais: https://arxiv.org/abs/2502.12018
4. Otimização Auto-Supervisionada de Prompt (SPO)
Resumo
Prompts de alta qualidade são cruciais para aprimorar o raciocínio de LLMs, mas o design manual de prompt exige especialização e iteração. Os métodos automatizados existentes dependem fortemente de referências rotuladas, limitando a aplicabilidade no mundo real.
O SPO apresenta um framework auto-supervisionado que descobre prompts eficazes para tarefas tanto fechadas quanto abertas, sem referências externas.
Principais Contribuições
Sinais auto-supervisionados derivados puramente das saídas dos LLMs.
Usa LLMs tanto como avaliador quanto como otimizador.
Alcança desempenho de ponta com 1–5% do custo dos métodos tradicionais.
Leia mais: https://arxiv.org/abs/2502.06855
5. Melhorando a Fidelidade de Contexto por meio do Native Retrieval-Augmented Reasoning (CARE)
Resumo
LLMs frequentemente alucinam respostas inconsistentes com o contexto fornecido. Soluções tradicionais exigem conjuntos de dados supervisionados caros ou dependem de recuperação externa que subutiliza o contexto fornecido pelo usuário.
O CARE apresenta um framework de raciocínio nativo aumentado por recuperação no qual LLMs integram dinamicamente evidências em contexto diretamente na cadeia de raciocínio.
Principais Contribuições
Introduz a recuperação em contexto como parte do processo de raciocínio.
Requer o mínimo de dados rotulados e usa aprendizado por currículo para tarefas complexas.
Supera SFT, RAG tradicional e métodos de recuperação externa em benchmarks de QA.
Leia mais: https://openreview.net/forum?id=qTsU1QLOph
6. FACT: Examinando a Eficácia da Reescrita Iterativa de Contexto para Recuperação de Múltiplos Fatos
Resumo
Grandes Modelos de Linguagem (LLMs) são eficazes em recuperar fatos únicos de contextos longos, mas enfrentam dificuldades quando múltiplos fatos precisam ser recuperados simultaneamente. Uma limitação importante observada é o fenômeno de “perdido no meio”, no qual os LLMs gradualmente perdem o acompanhamento de informações importantes durante a geração, levando a saídas incompletas ou imprecisas.
Para resolver isso, os autores propõem Find All Crucial Texts (FACT) — um método iterativo de reescrita de contexto que refina progressivamente a entrada, permitindo que o modelo capture fatos críticos passo a passo.
Principais Contribuições
Identifica e analisa o fenômeno de “perdido no meio” na recuperação de múltiplos fatos.
Introduz o FACT, uma abordagem iterativa de recuperação e reescrita que melhora incrementalmente a cobertura factual.
Demonstra ganhos significativos de desempenho em benchmarks de recuperação de múltiplos fatos, embora com melhorias menores em tarefas gerais de QA.
Destaca a necessidade de estratégias mais robustas na recuperação em contextos longos.
Leia mais: https://arxiv.org/abs/2410.21012
7. SELA: Agentes LLM Aprimorados por Busca em Árvore para Machine Learning Automatizado
Resumo
Agentes AutoML baseados em LLM frequentemente geram pipelines com baixa diversidade e subótimos. O SELA utiliza Monte Carlo Tree Search (MCTS) para otimizar a tomada de decisão do agente e a exploração de pipelines.
Principais Contribuições
Aplica métodos de busca em árvore para melhorar a exploração em AutoML.
Refina iterativamente pipelines com feedback experimental.
Supera baselines tradicionais e baseados em agentes de AutoML em 20 conjuntos de dados.
Leia mais: https://arxiv.org/abs/2410.17238
8. AFlow: Automatizando a Geração de Fluxos de Trabalho Agênticos
Resumo
Construir fluxos de trabalho agênticos para LLMs exige muito esforço e não é totalmente automatizado. O AFlow reformula a otimização de fluxos de trabalho como um problema de busca sobre grafos de código, usando MCTS para refinar iterativamente os fluxos de trabalho com feedback de execução.
Principais Contribuições
Define a otimização de fluxos de trabalho como busca em grafo de código.
Permite que modelos menores superem o GPT-4o por uma fração do custo.
Alcança uma melhoria de 5,7% em relação aos baselines de ponta.
Leia mais: https://arxiv.org/abs/2410.10762
9. Data Interpreter: Um Agente LLM para Ciência de Dados
Resumo
Abordagens existentes enfrentam dificuldades com fluxos de trabalho completos de ciência de dados, dependências dinâmicas entre tarefas e requisitos de conhecimento especializado em domínio.
O Data Interpreter apresenta:
Modelagem Hierárquica de Grafos: divide problemas em subproblemas com nós dinâmicos.
Geração Programável de Nós: refina e valida código iterativamente para garantir robustez.
Principais Contribuições
Primeiro agente LLM adaptado para fluxos de trabalho completos de ciência de dados.
Alcança melhoria de 25% na acurácia no InfiAgent-DABench.
Aumenta significativamente o desempenho em machine learning, tarefas abertas e no conjunto de dados MATH.
Leia mais: https://arxiv.org/abs/2402.18679
10. MetaGPT: Meta Programming para um Framework Colaborativo de Múltiplos Agentes
Resumo
Sistemas de múltiplos agentes baseados em LLM frequentemente falham em tarefas complexas devido a alucinações em cascata. O MetaGPT codifica Standard Operating Procedures (SOPs) em sequências de prompts, simplificando fluxos de trabalho e reduzindo erros.
Principais Contribuições
Introduz meta-programação para colaboração entre múltiplos agentes.
Incorpora fluxos de trabalho humanos baseados em SOP nos prompts de agentes.
Permite atribuição eficiente de papéis e decomposição de tarefas.
Demonstra estabilidade e acurácia superiores em tarefas colaborativas de engenharia de software.
Leia mais: https://arxiv.org/abs/2308.00352