学術リソースにアクセス
Atoms のマルチエージェント、推論、ワークフロー機能を支える研究論文と学術リソース。
Atoms は世界中のトップ大学や研究機関と連携し、マルチエージェント・フレームワーク、LLM 推論、コンテキスト拡張、自動化ワークフローに関する最先端の研究を生み出しています。
これらの研究は理論的進歩を前進させるだけでなく、マルチエージェント協調、データ解釈、RAG 強化推論、プロンプト最適化といった分野における Atoms の製品機能も強化しています。
1. クリックするまでわからない:実運用対応ソフトウェア評価のための自動 GUI テスト
要旨
大規模言語モデル(LLM)やコードエージェントが、孤立したスニペットの生成から、GUI、対話ロジック、動的な振る舞いを備えた完全なアプリケーションの構築へと進化するにつれ、現在のベンチマークでは実運用対応ソフトウェアを効果的に評価できません。静的チェックや二値の合否スクリプトでは、実際の操作を通じて初めて現れる現実世界での使いやすさを見落としてしまいます。
これに対処するため、著者らは RealDevWorld を導入し、LLM がゼロから実運用対応リポジトリを生成する能力をテストするための、エンドツーエンドの自動評価フレームワークを提示しています。
主な貢献
実運用対応アプリケーション向け初の GUI ベースのエンドツーエンド評価フレームワーク。
194 の多様なマルチモーダル・エンジニアリング課題を含むベンチマーク RealDevBench を導入。
GUI ベースのユーザー操作をシミュレートして総合評価を行う、審査者としてのエージェントシステム AppEvalPilot を提案。
手動レビューへの依存を減らしながら、高い人間整合性(精度 0.92、相関 0.85)を達成。
続きを読む: https://arxiv.org/abs/2508.14104
2. Foundation Agents における進展と課題:脳着想型知能から進化的・協調的・安全なシステムへ
要旨
LLM の登場は AI に変革的な転換をもたらし、領域横断で推論、知覚、行動が可能な知能エージェントを実現しました。このようなエージェントを設計し、評価し、継続的に改善していくことには、多面的な課題があります。
このサーベイは、認知科学、神経科学、計算の知見を統合した脳着想型モジュラーアーキテクチャという枠組みを通じて、 Foundation Agents の包括的な概要を提供します。
主な貢献
エージェントの構成要素を脳の機能(記憶、モデリング、目標、感情)に対応付けるモジュラーフレームワークを提案。
進化的メカニズムを通じた自己改善と継続的適応を探究。
マルチエージェントシステムと創発する集合知を検討。
実世界への導入における安全性、堅牢性、アラインメントの課題を扱う。
続きを読む: https://arxiv.org/abs/2504.01990
3. Markov LLM Test-Time Scaling のための Atom of Thoughts
要旨
LLM は学習時のスケーリングによって恩恵を受けますが、 test-time scaling は推論をさらに強化します。しかし、蓄積された履歴コンテキストは計算資源を浪費し、推論を妨げる可能性があります。
この論文では Atom of Thoughts (AoT) を導入し、複雑な推論を 原子的で記憶を持たないサブ質問 に分解することで、Markov 的な推論プロセスを形成します。
主な貢献
原子的推論 を定義:質問を DAG の部分問題に分解し、それらを縮約する。
既存の test-time scaling 手法にプラグインとして互換性を提供。
コンテキストの冗長性と計算の無駄を減らし、効率を改善。
6 つのベンチマークで大幅な性能向上を実証。
続きを読む: https://arxiv.org/abs/2502.12018
4. Self-Supervised Prompt Optimization (SPO)
要旨
高品質なプロンプトは LLM の推論強化に不可欠ですが、手動でのプロンプト設計には専門知識と反復作業が必要です。既存の自動化手法はラベル付き参照データに大きく依存しており、実世界での適用性が制限されています。
SPO は、外部参照なしでクローズドエンド型タスクとオープンエンド型タスクの両方に対して効果的なプロンプトを発見する自己教師ありフレームワークを導入します。
主な貢献
LLM の出力のみから導かれる自己教師ありシグナル。
評価者と最適化器の両方として LLM を使用。
従来手法の 1–5% のコスト で最先端性能を達成。
続きを読む: https://arxiv.org/abs/2502.06855
5. Native Retrieval-Augmented Reasoning (CARE) によるコンテキスト忠実性の向上
要旨
LLM は、与えられたコンテキストと整合しない回答をハルシネーションすることがよくあります。従来の解決策は、高価な教師ありデータセットを必要とするか、ユーザー提供コンテキストを十分に活用しない外部検索に依存しています。
CARE は、LLM がコンテキスト内の根拠を推論チェーンに直接動的統合する native retrieval-augmented reasoning フレームワークを導入します。
主な貢献
推論プロセスの一部としてコンテキスト内検索を導入。
必要なラベル付きデータが最小限で、複雑なタスクにはカリキュラム学習を使用。
QA ベンチマークにおいて、SFT、従来の RAG、外部検索手法を上回る性能を達成。
続きを読む: https://openreview.net/forum?id=qTsU1QLOph
6. FACT:複数事実検索のための反復的コンテキスト書き換えの有効性の検証
要旨
大規模言語モデル(LLM)は長いコンテキストから単一の事実を取り出すことには優れていますが、複数の事実を同時に取り出す必要がある場合には苦戦します。観察される主要な制約のひとつが 「lost-in-the-middle 現象」 であり、これは生成中に LLM が重要な情報を徐々に見失い、不完全または不正確な出力につながる現象です。
これに対処するため、著者らは Find All Crucial Texts (FACT) を提案しています。これは入力を段階的に洗練し、モデルが重要な事実を一歩ずつ捉えられるようにする 反復的コンテキスト書き換え手法 です。
主な貢献
複数事実検索における「lost-in-the-middle 現象」を特定し、分析。
事実カバレッジを段階的に向上させる反復的検索・書き換えアプローチ FACT を導入。
一般的な QA タスクでは改善が小さいものの、複数事実検索ベンチマークで大幅な性能向上を実証。
長文コンテキスト検索において、より堅牢な戦略の必要性を強調。
続きを読む: https://arxiv.org/abs/2410.21012
7. SELA:自動機械学習のための木探索強化 LLM エージェント
要旨
LLM ベースの AutoML エージェントは、多様性の低い最適でないパイプラインを生成しがちです。 SELA は Monte Carlo Tree Search(MCTS)を活用して、エージェントの意思決定とパイプライン探索を最適化します。
主な貢献
AutoML 探索を改善するために木探索手法を適用。
実験からのフィードバックを用いてパイプラインを反復的に改良。
20 のデータセットで従来型およびエージェントベースの AutoML ベースラインを上回る性能を達成。
続きを読む: https://arxiv.org/abs/2410.17238
8. AFlow:エージェント型ワークフロー生成の自動化
要旨
LLM 向けのエージェント型ワークフローの構築は労力がかかり、完全には自動化されていません。 AFlow は、ワークフロー最適化をコードグラフ上の探索問題として再定式化し、MCTS を用いて実行フィードバックに基づきワークフローを反復的に改良します。
主な貢献
ワークフロー最適化をコードグラフ探索として定義。
小規模モデルが GPT-4o をわずかなコストで上回ることを可能に。
最先端ベースラインに対して 5.7% の改善 を達成。
続きを読む: https://arxiv.org/abs/2410.10762
9. Data Interpreter:データサイエンスのための LLM エージェント
要旨
既存のアプローチは、エンドツーエンドのデータサイエンスワークフロー、動的なタスク依存関係、ドメイン専門知識の要件への対応に苦戦しています。
Data Interpreter では、次を導入しています。
階層的グラフモデリング:問題を動的ノードを持つ部分問題に分解。
プログラム可能なノード生成:堅牢性のためにコードを反復的に改良・検証。
主な貢献
完全なデータサイエンスワークフロー向けに特化した初の LLM エージェント。
InfiAgent-DABench で 25% の精度向上 を達成。
機械学習、オープンエンド型タスク、MATH データセットで性能を大幅に向上。
続きを読む: https://arxiv.org/abs/2402.18679
10. MetaGPT:マルチエージェント協調フレームワークのためのメタプログラミング
要旨
LLM ベースのマルチエージェントシステムは、連鎖的なハルシネーションにより複雑なタスクで失敗することがよくあります。 MetaGPT は 標準作業手順(SOP) をプロンプトシーケンスにエンコードすることで、ワークフローを合理化し、エラーを減らします。
主な貢献
マルチエージェント協調のためのメタプログラミングを導入。
SOP ベースの人間のワークフローをエージェントのプロンプトに組み込み。
効率的な役割割り当てとタスク分解を可能に。
協調的ソフトウェアエンジニアリング作業において、優れた安定性と精度を実証。