Atoms
Tips & Tutorials

Toegang tot academische Bronnen

Onderzoeksartikelen en academische bronnen achter Atoms’ multi-agent-, redeneer- en workflowcapaciteiten.

Atoms werkt samen met toonaangevende universiteiten en onderzoeksinstituten wereldwijd en produceert baanbrekend onderzoek naar multi-agent-frameworks, LLM-redenering, contextverrijking en geautomatiseerde workflows.

Deze werken stimuleren niet alleen theoretische vooruitgang, maar versterken ook Atoms’ productcapaciteiten op gebieden zoals multi-agent-samenwerking, datainterpretatie, RAG-versterkte redenering en promptoptimalisatie.

1. Je weet het pas als je klikt: geautomatiseerd GUI-testen voor evaluatie van productierijpe software

Samenvatting

Naarmate grote taalmodellen (LLM's) en code-agents zich ontwikkelen van het genereren van losse snippets naar het bouwen van volledige applicaties met GUI's, interactieve logica en dynamisch gedrag, slagen huidige benchmarks er niet in om productierijpe software effectief te evalueren. Statische controles of binaire pass/fail-scripts missen bruikbaarheid in de echte wereld, die alleen door interactie zichtbaar wordt.

Om dit aan te pakken introduceren de auteurs RealDevWorld, een end-to-end geautomatiseerd evaluatiekader voor het testen van het vermogen van LLM's om vanaf nul productierijpe repositories te genereren.

Belangrijkste bijdragen

  • Eerste GUI-gebaseerde end-to-end evaluatiekader voor productierijpe applicaties.

  • Introductie van RealDevBench, een benchmark met 194 diverse multimodale engineeringtaken.

  • Voorstel van AppEvalPilot, een agent-as-a-judge-systeem dat GUI-gebaseerde gebruikersinteracties simuleert voor holistische beoordeling.

  • Hoge overeenstemming met menselijke beoordeling bereikt (nauwkeurigheid 0.92, correlatie 0.85) terwijl de afhankelijkheid van handmatige review werd verminderd.

Lees meer: https://arxiv.org/abs/2508.14104

2. Vooruitgang en uitdagingen in Foundation Agents: van door het brein geïnspireerde intelligentie tot evolutionaire, collaboratieve en veilige systemen

Samenvatting

De opkomst van LLM's heeft een transformerende verschuiving in AI veroorzaakt, waardoor intelligente agents mogelijk zijn geworden die kunnen redeneren, waarnemen en handelen over verschillende domeinen heen. Het ontwerpen, evalueren en continu verbeteren van zulke agents brengt veelzijdige uitdagingen met zich mee.

Deze survey biedt een uitgebreid overzicht van Foundation Agents, vormgegeven vanuit door het brein geïnspireerde modulaire architecturen die inzichten uit cognitieve wetenschap, neurowetenschap en computation integreren.

Belangrijkste bijdragen

  • Stelt een modulair framework voor dat agentcomponenten koppelt aan hersenfunctionaliteiten (geheugen, modellering, doelen, emoties).

  • Onderzoekt zelfverbetering en voortdurende aanpassing via evolutionaire mechanismen.

  • Bestudeert multi-agent-systemen en opkomende collectieve intelligentie.

  • Behandelt uitdagingen rond veiligheid, robuustheid en alignment bij inzet in de echte wereld.

Lees meer: https://arxiv.org/abs/2504.01990

3. Atom of Thoughts voor Markov LLM test-time scaling

Samenvatting

LLM's profiteren van schaalvergroting tijdens training, en test-time scaling verbetert redenering verder. Opgebouwde historische context kan echter rekenkracht verspillen en redenering belemmeren.

Het artikel introduceert Atom of Thoughts (AoT), dat complexe redenering opsplitst in atomaire, geheugenloze subvraagstukken, waarmee een Markov-achtig redeneerproces ontstaat.

Belangrijkste bijdragen

  • Definieert atomaire redenering: vragen opsplitsen in DAG-subproblemen en deze samenvoegen.

  • Biedt compatibiliteit als plug-in voor bestaande test-time-scalingmethoden.

  • Verbetert efficiëntie door contextredundantie en rekenverspilling te verminderen.

  • Toont significante prestatiewinst aan op zes benchmarks.

Lees meer: https://arxiv.org/abs/2502.12018

4. Self-Supervised Prompt Optimization (SPO)

Samenvatting

Prompts van hoge kwaliteit zijn cruciaal voor het verbeteren van LLM-redenering, maar handmatig promptontwerp vereist expertise en iteratie. Bestaande geautomatiseerde methoden zijn sterk afhankelijk van gelabelde referenties, wat de toepasbaarheid in de praktijk beperkt.

SPO introduceert een self-supervised framework dat effectieve prompts ontdekt voor zowel gesloten als open taken zonder externe referenties.

Belangrijkste bijdragen

  • Self-supervised signalen uitsluitend afgeleid van LLM-uitvoer.

  • Gebruikt LLM's zowel als evaluator als optimizer.

  • Bereikt state-of-the-art prestaties tegen 1–5% van de kosten van traditionele methoden.

Lees meer: https://arxiv.org/abs/2502.06855

5. Verbetering van contextgetrouwheid via Native Retrieval-Augmented Reasoning (CARE)

Samenvatting

LLM's hallucineren vaak antwoorden die niet overeenkomen met de gegeven context. Traditionele oplossingen vereisen óf dure supervised datasets óf vertrouwen op externe retrieval die de door de gebruiker aangeleverde context onvoldoende benut.

CARE introduceert een native retrieval-augmented reasoning-framework waarin LLM's in-context bewijs dynamisch direct in de redeneerketen integreren.

Belangrijkste bijdragen

  • Introduceert in-context retrieval als onderdeel van het redeneerproces.

  • Vereist minimale gelabelde data en gebruikt curriculum learning voor complexe taken.

  • Presteert beter dan SFT, traditionele RAG en externe retrievalmethoden op QA-benchmarks.

Lees meer: https://openreview.net/forum?id=qTsU1QLOph

6. FACT: onderzoek naar de effectiviteit van iteratief herschrijven van context voor multi-fact retrieval

Samenvatting

Large Language Models (LLM's) zijn sterk in het ophalen van afzonderlijke feiten uit lange contexten, maar hebben moeite wanneer meerdere feiten tegelijk moeten worden opgehaald. Een belangrijke waargenomen beperking is het “lost-in-the-middle”-fenomeen, waarbij LLM's tijdens het genereren geleidelijk het spoor van belangrijke informatie bijster raken, wat leidt tot onvolledige of onnauwkeurige uitvoer.

Om dit aan te pakken stellen de auteurs Find All Crucial Texts (FACT) voor — een iteratieve methode voor het herschrijven van context die de invoer geleidelijk verfijnt, zodat het model stap voor stap kritieke feiten kan vastleggen.

Belangrijkste bijdragen

  • Identificeert en analyseert het “lost-in-the-middle”-fenomeen bij multi-fact retrieval.

  • Introduceert FACT, een iteratieve retrieval- en herschrijfaanpak die feitelijke dekking stapsgewijs verbetert.

  • Toont significante prestatiewinst aan in benchmarks voor multi-fact retrieval, zij het met kleinere verbeteringen op algemene QA-taken.

  • Benadrukt de noodzaak van robuustere strategieën voor retrieval in lange contexten.

Lees meer: https://arxiv.org/abs/2410.21012

7. SELA: Tree-Search Enhanced LLM Agents voor geautomatiseerd machine learning

Samenvatting

Op LLM's gebaseerde AutoML-agents genereren vaak pipelines met weinig diversiteit en suboptimale kwaliteit. SELA benut Monte Carlo Tree Search (MCTS) om de besluitvorming van agents en de verkenning van pipelines te optimaliseren.

Belangrijkste bijdragen

  • Past tree-search-methoden toe om AutoML-verkenning te verbeteren.

  • Verfijnt pipelines iteratief met experimentele feedback.

  • Presteert beter dan traditionele en agentgebaseerde AutoML-baselines op 20 datasets.

Lees meer: https://arxiv.org/abs/2410.17238

8. AFlow: automatisering van agentische workflowgeneratie

Samenvatting

Het opbouwen van agentische workflows voor LLM's is arbeidsintensief en niet volledig geautomatiseerd. AFlow herkadert workflowoptimalisatie als een zoekprobleem over codegrafen, waarbij MCTS wordt gebruikt om workflows iteratief te verfijnen met uitvoeringsfeedback.

Belangrijkste bijdragen

  • Definieert workflowoptimalisatie als zoeken in codegrafen.

  • Maakt het mogelijk dat kleinere modellen GPT-4o overtreffen tegen een fractie van de kosten.

  • Behaalt een verbetering van 5.7% ten opzichte van state-of-the-art baselines.

Lees meer: https://arxiv.org/abs/2410.10762

9. Data Interpreter: een LLM Agent voor data science

Samenvatting

Bestaande benaderingen hebben moeite met end-to-end data-science-workflows, dynamische taakafhankelijkheden en vereisten rond domeinexpertise.

Data Interpreter introduceert:

  • Hiërarchische grafmodellering: splitst problemen op in subproblemen met dynamische knooppunten.

  • Programmeerbare knooppuntgeneratie: verfijnt en valideert code iteratief voor robuustheid.

Belangrijkste bijdragen

  • Eerste LLM Agent afgestemd op volledige data-science-workflows.

  • Behaalt 25% nauwkeurigheidsverbetering op InfiAgent-DABench.

  • Verbetert prestaties op machine learning, open taken en de MATH-dataset aanzienlijk.

Lees meer: https://arxiv.org/abs/2402.18679

10. MetaGPT: meta-programmering voor een collaboratief multi-agent-framework

Samenvatting

Op LLM's gebaseerde multi-agent-systemen falen vaak bij complexe taken door cascaderende hallucinaties. MetaGPT codeert Standard Operating Procedures (SOPs) in promptsequenties, waardoor workflows worden gestroomlijnd en fouten worden verminderd.

Belangrijkste bijdragen

  • Introduceert meta-programmering voor multi-agent-samenwerking.

  • Integreert op SOP's gebaseerde menselijke workflows in agentprompts.

  • Maakt efficiënte roltoewijzing en taakdecompositie mogelijk.

  • Toont superieure stabiliteit en nauwkeurigheid aan in collaboratieve software-engineeringtaken.

Lees meer: https://arxiv.org/abs/2308.00352

Was deze pagina nuttig?

Gerelateerde artikelen