학술 리소스 이용하기
Atoms의 멀티 에이전트, 추론 및 워크플로 기능을 뒷받침하는 연구 논문과 학술 리소스입니다.
Atoms는 전 세계 유수의 대학 및 연구 기관과 협력하여 멀티 에이전트 프레임워크, LLM 추론, 컨텍스트 증강, 자동화된 워크플로에 관한 최첨단 연구를 수행하고 있습니다.
이러한 연구는 이론적 발전을 앞당길 뿐만 아니라 멀티 에이전트 협업, 데이터 해석, RAG 강화 추론, 프롬프트 최적화 등의 분야에서 Atoms의 제품 기능도 강화합니다.
1. 클릭하기 전에는 알 수 없다: 프로덕션 준비가 완료된 소프트웨어 평가를 위한 자동화된 GUI 테스트
초록
대규모 언어 모델(LLM)과 코드 에이전트가 개별 코드 조각 생성에서 GUI, 상호작용 로직, 동적 동작을 갖춘 전체 애플리케이션 구축으로 발전함에 따라, 현재의 벤치마크는 프로덕션 준비가 완료된 소프트웨어를 효과적으로 평가하지 못합니다. 정적 검사나 이진 통과/실패 스크립트는 실제 사용성을 간과하며, 이러한 사용성은 상호작용을 통해서만 드러납니다.
이를 해결하기 위해 저자들은 LLM이 처음부터 프로덕션 준비가 완료된 리포지토리를 생성하는 능력을 테스트하기 위한 엔드 투 엔드 자동 평가 프레임워크인 RealDevWorld를 소개합니다.
주요 기여
프로덕션 준비가 완료된 애플리케이션을 위한 최초의 GUI 기반 엔드 투 엔드 평가 프레임워크.
194개의 다양한 멀티모달 엔지니어링 작업으로 구성된 벤치마크 RealDevBench를 도입.
GUI 기반 사용자 상호작용을 시뮬레이션하여 종합적으로 평가하는 심사자 역할의 에이전트 시스템 AppEvalPilot를 제안.
수동 검토 의존도를 낮추면서도 높은 수준의 인간 정렬(정확도 0.92, 상관계수 0.85)을 달성.
더 읽어보기: https://arxiv.org/abs/2508.14104
2. Foundation Agents의 발전과 과제: 뇌에서 영감을 받은 지능에서 진화형, 협업형, 안전한 시스템까지
초록
LLM의 등장은 AI에 혁신적인 전환을 촉진했으며, 이를 통해 여러 도메인에 걸쳐 추론, 지각, 행동이 가능한 지능형 에이전트가 가능해졌습니다. 이러한 에이전트를 설계하고, 평가하며, 지속적으로 개선하는 일은 다면적인 과제를 수반합니다.
이 서베이는 인지과학, 신경과학, 계산의 통찰을 통합하는 뇌 영감형 모듈식 아키텍처를 중심으로 Foundation Agents에 대한 포괄적인 개요를 제공합니다.
주요 기여
에이전트 구성 요소를 뇌 기능(기억, 모델링, 목표, 감정)에 대응시키는 모듈식 프레임워크를 제안.
진화 메커니즘을 통한 자기 개선 및 지속적 적응을 탐구.
멀티 에이전트 시스템과 창발적 집단 지능을 검토.
실제 배포에서의 안전성, 견고성, 정렬 과제를 다룸.
더 읽어보기: https://arxiv.org/abs/2504.01990
3. Markov LLM 테스트 시점 스케일링을 위한 Atom of Thoughts
초록
LLM은 학습 중 스케일링의 이점을 얻으며, test-time scaling 은 추론을 더욱 향상시킵니다. 그러나 누적된 과거 컨텍스트는 연산 자원을 낭비하고 추론을 방해할 수 있습니다.
이 논문은 복잡한 추론을 원자적이고 메모리 없는 하위 질문 으로 분해하여 Markov와 유사한 추론 과정을 형성하는 Atom of Thoughts (AoT) 를 소개합니다.
주요 기여
원자적 추론 을 정의: 질문을 DAG 하위 문제로 분해하고 이를 축약.
기존 test-time scaling 방법에 플러그인으로 호환 가능하도록 제공.
컨텍스트 중복과 계산 낭비를 줄여 효율성을 개선.
6개 벤치마크 전반에서 상당한 성능 향상을 입증.
더 읽어보기: https://arxiv.org/abs/2502.12018
4. Self-Supervised Prompt Optimization (SPO)
초록
고품질 프롬프트는 LLM 추론 향상에 매우 중요하지만, 수동 프롬프트 설계에는 전문성과 반복 작업이 필요합니다. 기존 자동화 방법은 라벨이 지정된 참조 데이터에 크게 의존하므로 실제 적용 가능성이 제한됩니다.
SPO 는 외부 참조 없이 닫힌형 및 열린형 작업 모두에 대해 효과적인 프롬프트를 발견하는 자기 지도 프레임워크를 도입합니다.
주요 기여
LLM 출력만으로 도출되는 자기 지도 신호.
LLM을 평가자이자 최적화기로 활용.
기존 방법 비용의 1–5% 로 최고 수준 성능을 달성.
더 읽어보기: https://arxiv.org/abs/2502.06855
5. Native Retrieval-Augmented Reasoning (CARE)을 통한 컨텍스트 충실도 향상
초록
LLM은 주어진 컨텍스트와 일치하지 않는 답변을 할루시네이션하는 경우가 많습니다. 기존 해결책은 비용이 많이 드는 지도 데이터셋이 필요하거나, 사용자가 제공한 컨텍스트를 충분히 활용하지 못하는 외부 검색에 의존합니다.
CARE 는 LLM이 컨텍스트 내 증거를 추론 체인에 직접 동적으로 통합하는 native retrieval-augmented reasoning 프레임워크를 도입합니다.
주요 기여
추론 과정의 일부로 컨텍스트 내 검색을 도입.
최소한의 라벨링 데이터만 필요하며 복잡한 작업에는 커리큘럼 학습을 사용.
QA 벤치마크에서 SFT, 기존 RAG, 외부 검색 방법을 능가.
더 읽어보기: https://openreview.net/forum?id=qTsU1QLOph
6. FACT: 다중 사실 검색을 위한 반복적 컨텍스트 재작성의 효과성 검토
초록
대규모 언어 모델(LLM)은 긴 컨텍스트에서 단일 사실을 검색하는 데는 강하지만, 여러 사실을 동시에 검색해야 할 때는 어려움을 겪습니다. 관찰된 핵심 한계 중 하나는 “중간에서 길을 잃는” 현상 으로, 생성 과정에서 LLM이 중요한 정보를 점차 놓치게 되어 불완전하거나 부정확한 출력으로 이어집니다.
이를 해결하기 위해 저자들은 입력을 점진적으로 정제하여 모델이 중요한 사실을 단계적으로 포착할 수 있도록 하는 반복적 컨텍스트 재작성 방법 인 Find All Crucial Texts (FACT) 를 제안합니다.
주요 기여
다중 사실 검색에서 “중간에서 길을 잃는” 현상을 식별하고 분석.
사실 포괄성을 점진적으로 향상시키는 반복적 검색 및 재작성 접근법 FACT를 도입.
일반 QA 작업에서는 향상 폭이 더 작지만, 다중 사실 검색 벤치마크에서 상당한 성능 향상을 입증.
장문 컨텍스트 검색에서 더 견고한 전략의 필요성을 강조.
더 읽어보기: https://arxiv.org/abs/2410.21012
7. SELA: 자동화된 머신 러닝을 위한 트리 탐색 강화 LLM 에이전트
초록
LLM 기반 AutoML 에이전트는 종종 다양성이 낮고 최적이 아닌 파이프라인을 생성합니다. SELA 는 Monte Carlo Tree Search(MCTS)를 활용해 에이전트 의사결정과 파이프라인 탐색을 최적화합니다.
주요 기여
AutoML 탐색 개선을 위해 트리 탐색 방법을 적용.
실험 피드백으로 파이프라인을 반복적으로 정제.
20개 데이터셋에서 기존 및 에이전트 기반 AutoML 기준선을 능가.
더 읽어보기: https://arxiv.org/abs/2410.17238
8. AFlow: 에이전트형 워크플로 생성 자동화
초록
LLM을 위한 에이전트형 워크플로 구축은 노동 집약적이며 완전히 자동화되어 있지 않습니다. AFlow 는 워크플로 최적화를 코드 그래프에 대한 탐색 문제로 재구성하고, MCTS를 사용해 실행 피드백으로 워크플로를 반복적으로 정제합니다.
주요 기여
워크플로 최적화를 코드 그래프 탐색으로 정의.
더 작은 모델이 GPT-4o를 훨씬 적은 비용으로 능가할 수 있게 함.
최신 기준선 대비 5.7% 향상 을 달성.
더 읽어보기: https://arxiv.org/abs/2410.10762
9. Data Interpreter: 데이터 사이언스를 위한 LLM 에이전트
초록
기존 접근법은 엔드 투 엔드 데이터 사이언스 워크플로, 동적인 작업 의존성, 도메인 전문성 요구사항을 처리하는 데 어려움을 겪습니다.
Data Interpreter 는 다음을 도입합니다:
계층적 그래프 모델링: 문제를 동적 노드를 갖는 하위 문제로 분해.
프로그래밍 가능한 노드 생성: 견고성을 위해 코드를 반복적으로 정제하고 검증.
주요 기여
전체 데이터 사이언스 워크플로에 맞춰 설계된 최초의 LLM 에이전트.
InfiAgent-DABench에서 정확도 25% 향상 을 달성.
머신 러닝, 열린형 작업, MATH 데이터셋 성능을 크게 향상.
더 읽어보기: https://arxiv.org/abs/2402.18679
10. MetaGPT: 멀티 에이전트 협업 프레임워크를 위한 메타 프로그래밍
초록
LLM 기반 멀티 에이전트 시스템은 연쇄적인 할루시네이션으로 인해 복잡한 작업에서 종종 실패합니다. MetaGPT 는 표준 운영 절차(SOP) 를 프롬프트 시퀀스에 인코딩하여 워크플로를 간소화하고 오류를 줄입니다.
주요 기여
멀티 에이전트 협업을 위한 메타 프로그래밍을 도입.
SOP 기반 인간 워크플로를 에이전트 프롬프트에 통합.
효율적인 역할 할당과 작업 분해를 가능하게 함.
협업 소프트웨어 엔지니어링 작업에서 뛰어난 안정성과 정확도를 입증.
더 읽어보기: https://arxiv.org/abs/2308.00352