Atoms
Tips och handledningar

Få tillgång till akademiska resurser

Forskningsartiklar och akademiska resurser bakom Atoms kapacitet inom multi-agent, resonemang och arbetsflöden.

Atoms samarbetar med ledande universitet och forskningsinstitut världen över och producerar banbrytande forskning om multi-agent-ramverk, LLM-resonemang, kontextutökning och automatiserade arbetsflöden.

Dessa arbeten driver inte bara den teoretiska utvecklingen framåt utan stärker också Atoms produktkapacitet inom områden som multi-agent-samarbete, datatolkning, RAG-förbättrat resonemang och promptoptimering.

1. Du vet inte förrän du klickar: Automatiserad GUI-testning för utvärdering av produktionsredo programvara

Sammanfattning

När stora språkmodeller (LLM:er) och kodagenter utvecklas från att generera isolerade kodsnuttar till att bygga fullständiga applikationer med GUI:er, interaktiv logik och dynamiska beteenden, misslyckas nuvarande benchmarkar med att effektivt utvärdera produktionsredo programvara. Statiska kontroller eller binära skript för godkänd/underkänd förbiser användbarhet i verkliga miljöer, som endast framträder genom interaktion.

För att hantera detta introducerar författarna RealDevWorld, ett heltäckande automatiserat utvärderingsramverk för att testa LLM:ers förmåga att generera produktionsredo kodförråd från grunden.

Viktiga bidrag

  • Första GUI-baserade heltäckande utvärderingsramverket för produktionsredo applikationer.

  • Introducerade RealDevBench, ett benchmark med 194 olika multimodala ingenjörsuppgifter.

  • Föreslog AppEvalPilot, ett agent-som-domare-system som simulerar GUI-baserade användarinteraktioner för holistisk bedömning.

  • Uppnådde hög överensstämmelse med mänskliga bedömningar (noggrannhet 0.92, korrelation 0.85) samtidigt som beroendet av manuell granskning minskades.

Läs mer: https://arxiv.org/abs/2508.14104

2. Framsteg och utmaningar inom Foundation Agents: Från hjärninspirerad intelligens till evolutionära, samarbetsinriktade och säkra system

Sammanfattning

Framväxten av LLM:er har katalyserat ett omvälvande skifte inom AI och möjliggjort intelligenta agenter som kan resonera, uppfatta och agera över olika domäner. Att utforma, utvärdera och kontinuerligt förbättra sådana agenter innebär mångfacetterade utmaningar.

Denna översikt ger en heltäckande genomgång av Foundation Agents, inramad genom hjärninspirerade modulära arkitekturer som integrerar insikter från kognitionsvetenskap, neurovetenskap och beräkning.

Viktiga bidrag

  • Föreslår ett modulärt ramverk som mappar agentkomponenter till hjärnans funktioner (minne, modellering, mål, känslor).

  • Utforskar självförbättring och kontinuerlig anpassning genom evolutionära mekanismer.

  • Undersöker multi-agent-system och framväxande kollektiv intelligens.

  • Behandlar utmaningar kring säkerhet, robusthet och alignment vid driftsättning i verkliga miljöer.

Läs mer: https://arxiv.org/abs/2504.01990

3. Atom of Thoughts för Markov LLM Test-Time Scaling

Sammanfattning

LLM:er gynnas av skalning under träning, och test-time scaling förbättrar resonemang ytterligare. Ackumulerad historisk kontext kan dock slösa beräkningsresurser och hämma resonemang.

Artikeln introducerar Atom of Thoughts (AoT), som bryter ned komplext resonemang i atomära, minneslösa delproblem, vilket bildar en Markov-liknande resonemangsprocess.

Viktiga bidrag

  • Definierar atomärt resonemang: att bryta ned frågor i DAG-delproblem och sammanfoga dem.

  • Erbjuder kompatibilitet som ett plug-in för befintliga metoder för test-time scaling.

  • Förbättrar effektiviteten genom att minska kontextredundans och onödigt beräkningsarbete.

  • Visar betydande prestandavinster över sex benchmarkar.

Läs mer: https://arxiv.org/abs/2502.12018

4. Self-Supervised Prompt Optimization (SPO)

Sammanfattning

Högkvalitativa promptar är avgörande för att förbättra LLM-resonemang, men manuell promptdesign kräver expertis och iteration. Befintliga automatiserade metoder förlitar sig i hög grad på märkta referenser, vilket begränsar användbarheten i verkliga tillämpningar.

SPO introducerar ett självövervakat ramverk som hittar effektiva promptar för både slutna och öppna uppgifter utan externa referenser.

Viktiga bidrag

  • Självövervakade signaler härledda enbart från LLM-utdata.

  • Använder LLM:er både som utvärderare och optimerare.

  • Uppnår prestanda i världsklass med 1–5% av kostnaden för traditionella metoder.

Läs mer: https://arxiv.org/abs/2502.06855

5. Förbättring av kontexttrogenhet via Native Retrieval-Augmented Reasoning (CARE)

Sammanfattning

LLM:er hallucinerar ofta svar som är inkonsekventa med given kontext. Traditionella lösningar kräver antingen dyra övervakade dataset eller förlitar sig på extern hämtning som inte utnyttjar användartillhandahållen kontext fullt ut.

CARE introducerar ett ramverk för native retrieval-augmented reasoning där LLM:er dynamiskt integrerar bevis i kontexten direkt i resonemangskedjan.

Viktiga bidrag

  • Introducerar hämtning i kontext som en del av resonemangsprocessen.

  • Kräver minimalt med märkt data och använder curriculum learning för komplexa uppgifter.

  • Överträffar SFT, traditionell RAG och externa hämtningsmetoder på QA-benchmarkar.

Läs mer: https://openreview.net/forum?id=qTsU1QLOph

6. FACT: Granskning av effektiviteten hos iterativ kontextomskrivning för hämtning av flera fakta

Sammanfattning

Stora språkmodeller (LLM:er) är starka på att hämta enskilda fakta från långa kontexter men har svårt när flera fakta måste hämtas samtidigt. En viktig begränsning som observerats är "lost-in-the-middle"-fenomenet, där LLM:er gradvis tappar bort viktig information under genereringen, vilket leder till ofullständiga eller felaktiga utdata.

För att hantera detta föreslår författarna Find All Crucial Texts (FACT) — en iterativ metod för kontextomskrivning som successivt förfinar indata och gör det möjligt för modellen att fånga kritiska fakta steg för steg.

Viktiga bidrag

  • Identifierar och analyserar "lost-in-the-middle"-fenomenet vid hämtning av flera fakta.

  • Introducerar FACT, en iterativ metod för hämtning och omskrivning som stegvis förbättrar faktatäckningen.

  • Visar betydande prestandavinster i benchmarkar för hämtning av flera fakta, men med mindre förbättringar på allmänna QA-uppgifter.

  • Betonar behovet av mer robusta strategier för hämtning i lång kontext.

Läs mer: https://arxiv.org/abs/2410.21012

7. SELA: Trädsökningsförstärkta LLM-agenter för automatiserat maskininlärning

Sammanfattning

LLM-baserade AutoML-agenter genererar ofta pipelines med låg diversitet och suboptimala resultat. SELA använder Monte Carlo Tree Search (MCTS) för att optimera agenters beslutsfattande och utforskning av pipelines.

Viktiga bidrag

  • Tillämpa trädsökningsmetoder för att förbättra AutoML-utforskning.

  • Förfinar iterativt pipelines med experimentell återkoppling.

  • Överträffar traditionella och agentbaserade AutoML-baslinjer på 20 dataset.

Läs mer: https://arxiv.org/abs/2410.17238

8. AFlow: Automatisering av agentiska arbetsflödesgenerering

Sammanfattning

Att konstruera agentiska arbetsflöden för LLM:er är arbetsintensivt och inte fullt automatiserat. AFlow omformulerar arbetsflödesoptimering som ett sökproblem över kodgrafer och använder MCTS för att iterativt förfina arbetsflöden med exekveringsåterkoppling.

Viktiga bidrag

  • Definierar arbetsflödesoptimering som sökning i kodgrafer.

  • Gör det möjligt för mindre modeller att överträffa GPT-4o till en bråkdel av kostnaden.

  • Uppnår en 5.7% förbättring jämfört med state-of-the-art-baslinjer.

Läs mer: https://arxiv.org/abs/2410.10762

9. Data Interpreter: En LLM-Agent för datavetenskap

Sammanfattning

Befintliga tillvägagångssätt har svårt med heltäckande arbetsflöden inom datavetenskap, dynamiska uppgiftsberoenden och krav på domänexpertis.

Data Interpreter introducerar:

  • Hierarchical Graph Modeling: bryter ned problem i delproblem med dynamiska noder.

  • Programmable Node Generation: förfinar och validerar iterativt kod för robusthet.

Viktiga bidrag

  • Första LLM-agenten anpassad för fullständiga arbetsflöden inom datavetenskap.

  • Uppnår 25% förbättring i noggrannhet på InfiAgent-DABench.

  • Förbättrar prestandan avsevärt för maskininlärning, öppna uppgifter och MATH-datasetet.

Läs mer: https://arxiv.org/abs/2402.18679

10. MetaGPT: Metaprogrammering för ett samarbetsramverk med flera agenter

Sammanfattning

LLM-baserade multi-agent-system misslyckas ofta med komplexa uppgifter på grund av kedjevis uppträdande hallucinationer. MetaGPT kodar in Standard Operating Procedures (SOPs) i promptsekvenser, vilket effektiviserar arbetsflöden och minskar fel.

Viktiga bidrag

  • Introducerar metaprogrammering för multi-agent-samarbete.

  • Integrerar SOP-baserade mänskliga arbetsflöden i agentpromptar.

  • Möjliggör effektiv rolltilldelning och uppgiftsnedbrytning.

  • Visar överlägsen stabilitet och noggrannhet i samarbetsinriktade programvarutekniska uppgifter.

Läs mer: https://arxiv.org/abs/2308.00352

Var den här sidan hjälpsam?

Relaterade artiklar