存取學術資料
關於 Atoms 的多智能體、推理與工作流程能力背後的研究論文與學術資料。
Atoms 與全球頂尖大學及研究機構合作,產出關於多智能體框架、LLM 推理、上下文增強與自動化工作流程的前沿研究。
這些成果不僅推動了理論進展,也強化了 Atoms 在多智能體協作、資料解讀、RAG 增強推理與提示詞優化等領域的產品能力。
1. 不點擊就不知道:用於可投入生產軟體評估的自動化 GUI 測試
摘要
隨著大型語言模型(LLMs)與程式碼智能體從生成孤立片段進化到建構具備 GUI、互動邏輯與動態行為的完整應用程式,現有基準已無法有效評估可投入生產的軟體。靜態檢查或二元通過/失敗腳本忽略了真實世界中的可用性,而這種可用性只有透過互動才會顯現。
為了解決此問題,作者提出 RealDevWorld,這是一個端到端的自動化評估框架,用於測試 LLMs 從零開始生成可投入生產儲存庫的能力。
主要貢獻
首個以 GUI 為基礎、針對可投入生產應用程式的端到端評估框架。
推出 RealDevBench,這是一個包含 194 項多樣化多模態工程任務的基準。
提出 AppEvalPilot,一個作為裁判的智能體系統,可模擬基於 GUI 的使用者互動以進行整體評估。
在降低對人工審查依賴的同時,達成高人類一致性(準確率 0.92、相關性 0.85)。
閱讀更多:https://arxiv.org/abs/2508.14104
2. Foundation Agents 的進展與挑戰:從受大腦啟發的智慧到演化式、協作式與安全系統
摘要
LLMs 的出現促成了 AI 的變革性轉變,使具備跨領域推理、感知與行動能力的智能體成為可能。設計、評估並持續改進此類智能體帶來了多面向的挑戰。
本綜述透過受大腦啟發的模組化架構,整合認知科學、神經科學與計算領域的洞見,全面概述 Foundation Agents。
主要貢獻
提出一個模組化框架,將智能體元件對應到大腦功能(記憶、建模、目標、情緒)。
探討透過演化機制實現自我改進與持續適應。
檢視多智能體系統與湧現的集體智慧。
處理真實世界部署中的安全性、穩健性與對齊挑戰。
閱讀更多:https://arxiv.org/abs/2504.01990
3. 用於 Markov LLM 測試時擴展的 Atom of Thoughts
摘要
LLMs 可受益於訓練期間的擴展,而 test-time scaling 會進一步提升推理能力。然而,累積的歷史上下文可能浪費運算資源並妨礙推理。
本文提出 Atom of Thoughts (AoT),將複雜推理分解為 原子化、無記憶的子問題,形成類似 Markov 的推理過程。
主要貢獻
定義 原子推理:將問題分解為 DAG 子問題並加以收縮。
可作為外掛與現有的 test-time scaling 方法相容。
透過減少上下文冗餘與運算浪費來提升效率。
在六項基準上展示顯著的效能提升。
閱讀更多:https://arxiv.org/abs/2502.12018
4. Self-Supervised Prompt Optimization (SPO)
摘要
高品質提示詞對提升 LLM 推理能力至關重要,但手動設計提示詞需要專業知識與反覆迭代。現有自動化方法高度依賴帶標註的參考資料,限制了其在真實世界中的適用性。
SPO 提出一種自我監督框架,能在沒有外部參考的情況下,為封閉式與開放式任務找出有效的提示詞。
主要貢獻
完全由 LLM 輸出衍生的自我監督訊號。
同時使用 LLM 作為評估器與優化器。
以傳統方法 1–5% 的成本 達成最先進效能。
閱讀更多:https://arxiv.org/abs/2502.06855
5. 透過 Native Retrieval-Augmented Reasoning (CARE) 提升上下文忠實度
摘要
LLMs 經常產生與給定上下文不一致的幻覺答案。傳統解法不是需要昂貴的監督式資料集,就是依賴外部檢索而未能充分利用使用者提供的上下文。
CARE 引入一種 原生檢索增強推理 框架,讓 LLMs 能夠將上下文中的證據動態直接整合到推理鏈中。
主要貢獻
將上下文內檢索引入為推理過程的一部分。
僅需極少量標註資料,並對複雜任務使用課程學習。
在問答基準上優於 SFT、傳統 RAG 與外部檢索方法。
閱讀更多:https://openreview.net/forum?id=qTsU1QLOph
6. FACT:檢視用於多事實檢索的迭代式上下文重寫有效性
摘要
大型語言模型(LLMs)在從長上下文中檢索單一事實方面表現強勁,但在必須同時檢索多個事實時則表現吃力。觀察到的一項關鍵限制是 「中間遺失」現象,也就是 LLMs 在生成過程中逐漸失去對重要資訊的掌握,進而導致輸出不完整或不準確。
為了解決這個問題,作者提出 Find All Crucial Texts (FACT) —— 一種 迭代式上下文重寫方法,可逐步精煉輸入,使模型能一步一步捕捉關鍵事實。
主要貢獻
識別並分析多事實檢索中的「中間遺失」現象。
提出 FACT,一種可逐步改善事實涵蓋率的迭代式檢索與重寫方法。
在多事實檢索基準上展示顯著效能提升,但在一般問答任務上的改善較小。
強調長上下文檢索需要更穩健的策略。
閱讀更多:https://arxiv.org/abs/2410.21012
7. SELA:用於自動化機器學習的樹狀搜尋增強 LLM 智能體
摘要
基於 LLM 的 AutoML 智能體往往生成多樣性不足且非最佳的管線。SELA 利用蒙地卡羅樹搜尋(MCTS)來優化智能體決策與管線探索。
主要貢獻
應用樹狀搜尋方法來改善 AutoML 探索。
根據實驗回饋反覆精煉管線。
在 20 個資料集上優於傳統與基於智能體的 AutoML 基準方法。
閱讀更多:https://arxiv.org/abs/2410.17238
8. AFlow:自動化 Agentic 工作流程生成
摘要
為 LLMs 建構 agentic 工作流程相當耗費人力,且尚未完全自動化。AFlow 將工作流程優化重新定義為程式碼圖上的搜尋問題,使用 MCTS 根據執行回饋反覆精煉工作流程。
主要貢獻
將工作流程優化定義為程式碼圖搜尋。
讓較小型模型能以一小部分成本超越 GPT-4o。
相較於最先進基準達成 5.7% 提升。
閱讀更多:https://arxiv.org/abs/2410.10762
9. Data Interpreter:用於資料科學的 LLM 智能體
摘要
現有方法在端到端資料科學工作流程、動態任務相依性以及領域專業知識需求方面面臨困難。
Data Interpreter 提出:
階層式圖建模:將問題拆解為具有動態節點的子問題。
可程式化節點生成:反覆精煉並驗證程式碼,以提高穩健性。
主要貢獻
首個專為完整資料科學工作流程打造的 LLM 智能體。
在 InfiAgent-DABench 上達成 25% 準確率提升。
顯著提升機器學習、開放式任務與 MATH 資料集的表現。
閱讀更多:https://arxiv.org/abs/2402.18679
10. MetaGPT:用於多智能體協作框架的中介程式設計
摘要
基於 LLM 的多智能體系統在複雜任務中常因連鎖幻覺而失敗。MetaGPT 將 標準作業程序(SOPs) 編碼進提示詞序列中,藉此精簡工作流程並降低錯誤。
主要貢獻
為多智能體協作引入中介程式設計。
將基於 SOP 的人類工作流程納入智能體提示詞中。
實現高效率的角色指派與任務拆解。
在協作式軟體工程任務中展現更優異的穩定性與準確性。