Atoms
Mẹo & Hướng dẫn

Truy cập Tài nguyên học thuật

Các bài báo nghiên cứu và tài nguyên học thuật đứng sau các khả năng đa Agent, suy luận và quy trình làm việc của Atoms.

Atoms hợp tác với các trường đại học và viện nghiên cứu hàng đầu trên toàn thế giới, tạo ra những nghiên cứu tiên tiến về các framework đa Agent, suy luận LLM, tăng cường ngữ cảnh và quy trình làm việc tự động.

Những công trình này không chỉ thúc đẩy tiến bộ về mặt lý thuyết mà còn tăng cường năng lực sản phẩm của Atoms trong các lĩnh vực như cộng tác đa Agent, diễn giải dữ liệu, suy luận tăng cường RAG và tối ưu hóa câu lệnh.

1. Bạn sẽ không biết cho đến khi bạn nhấp: Kiểm thử GUI tự động để đánh giá phần mềm sẵn sàng cho môi trường production

Tóm tắt

Khi các mô hình ngôn ngữ lớn (LLM) và code agent phát triển từ việc tạo ra các đoạn mã riêng lẻ sang xây dựng các ứng dụng hoàn chỉnh với GUI, logic tương tác và hành vi động, các bộ tiêu chuẩn hiện tại không thể đánh giá hiệu quả phần mềm sẵn sàng cho môi trường production. Các phép kiểm tra tĩnh hoặc các script đạt/trượt nhị phân bỏ qua tính khả dụng trong thế giới thực, vốn chỉ xuất hiện thông qua tương tác.

Để giải quyết vấn đề này, các tác giả giới thiệu RealDevWorld, một framework đánh giá tự động đầu-cuối để kiểm tra khả năng của LLM trong việc tạo ra các repository sẵn sàng cho môi trường production từ đầu.

Đóng góp chính

  • Framework đánh giá đầu-cuối dựa trên GUI đầu tiên cho các ứng dụng sẵn sàng cho môi trường production.

  • Giới thiệu RealDevBench, một benchmark với 194 tác vụ kỹ thuật đa phương thức đa dạng.

  • Đề xuất AppEvalPilot, một hệ thống agent-as-a-judge mô phỏng tương tác người dùng dựa trên GUI để đánh giá toàn diện.

  • Đạt mức độ tương đồng cao với con người (độ chính xác 0.92, tương quan 0.85) đồng thời giảm sự phụ thuộc vào việc đánh giá thủ công.

Đọc thêm: https://arxiv.org/abs/2508.14104

2. Những tiến bộ và thách thức trong Foundation Agents: Từ trí tuệ lấy cảm hứng từ não bộ đến các hệ thống tiến hóa, cộng tác và an toàn

Tóm tắt

Sự xuất hiện của LLM đã thúc đẩy một bước chuyển mình mang tính biến đổi trong AI, cho phép tạo ra các agent thông minh có khả năng suy luận, tri giác và hành động trên nhiều lĩnh vực. Việc thiết kế, đánh giá và liên tục cải thiện các agent như vậy đặt ra những thách thức đa chiều.

Bài khảo sát này cung cấp một cái nhìn tổng quan toàn diện về Foundation Agents, được định hình thông qua các kiến trúc mô-đun lấy cảm hứng từ não bộ, tích hợp các hiểu biết từ khoa học nhận thức, khoa học thần kinh và tính toán.

Đóng góp chính

  • Đề xuất một framework mô-đun ánh xạ các thành phần của agent với các chức năng của não bộ (trí nhớ, mô hình hóa, mục tiêu, cảm xúc).

  • Khám phá khả năng tự cải thiện và thích nghi liên tục thông qua các cơ chế tiến hóa.

  • Nghiên cứu các hệ thống đa Agent và trí tuệ tập thể nổi sinh.

  • Giải quyết các thách thức về an toàn, độ bền vững và căn chỉnh trong triển khai thực tế.

Đọc thêm: https://arxiv.org/abs/2504.01990

3. Atom of Thoughts cho mở rộng thời gian suy luận Markov LLM

Tóm tắt

LLM được hưởng lợi từ việc mở rộng trong quá trình huấn luyện, và mở rộng thời gian suy luận còn tiếp tục nâng cao khả năng suy luận. Tuy nhiên, ngữ cảnh lịch sử tích lũy có thể làm lãng phí tài nguyên tính toán và cản trở việc suy luận.

Bài báo giới thiệu Atom of Thoughts (AoT), phương pháp phân rã suy luận phức tạp thành các câu hỏi con nguyên tử, không cần bộ nhớ, hình thành một quy trình suy luận giống Markov.

Đóng góp chính

  • Định nghĩa suy luận nguyên tử: phân rã câu hỏi thành các bài toán con DAG và rút gọn chúng.

  • Cung cấp khả năng tương thích như một plug-in cho các phương pháp mở rộng thời gian suy luận hiện có.

  • Cải thiện hiệu quả bằng cách giảm sự dư thừa ngữ cảnh và lãng phí tính toán.

  • Chứng minh mức tăng hiệu năng đáng kể trên sáu benchmark.

Đọc thêm: https://arxiv.org/abs/2502.12018

4. Tối ưu hóa Câu lệnh tự giám sát (SPO)

Tóm tắt

Các câu lệnh chất lượng cao đóng vai trò then chốt trong việc nâng cao khả năng suy luận của LLM, nhưng việc thiết kế câu lệnh thủ công đòi hỏi chuyên môn và nhiều vòng lặp. Các phương pháp tự động hiện có phụ thuộc nhiều vào các tham chiếu đã được gán nhãn, làm hạn chế khả năng áp dụng trong thực tế.

SPO giới thiệu một framework tự giám sát giúp khám phá các câu lệnh hiệu quả cho cả tác vụ đóng và tác vụ mở mà không cần tham chiếu bên ngoài.

Đóng góp chính

  • Tín hiệu tự giám sát được rút ra hoàn toàn từ đầu ra của LLM.

  • Sử dụng LLM vừa làm bộ đánh giá vừa làm bộ tối ưu.

  • Đạt hiệu năng tiên tiến nhất với 1–5% chi phí của các phương pháp truyền thống.

Đọc thêm: https://arxiv.org/abs/2502.06855

5. Cải thiện độ trung thực ngữ cảnh thông qua Native Retrieval-Augmented Reasoning (CARE)

Tóm tắt

LLM thường tạo ra ảo giác với các câu trả lời không nhất quán với ngữ cảnh được cung cấp. Các giải pháp truyền thống hoặc yêu cầu các bộ dữ liệu có giám sát tốn kém, hoặc dựa vào truy xuất bên ngoài nhưng không tận dụng tốt ngữ cảnh do người dùng cung cấp.

CARE giới thiệu một framework suy luận tăng cường truy xuất nguyên bản, trong đó LLM tích hợp động bằng chứng trong ngữ cảnh trực tiếp vào chuỗi suy luận.

Đóng góp chính

  • Giới thiệu truy xuất trong ngữ cảnh như một phần của quá trình suy luận.

  • Yêu cầu lượng dữ liệu gán nhãn tối thiểu và sử dụng curriculum learning cho các tác vụ phức tạp.

  • Vượt trội hơn SFT, RAG truyền thống và các phương pháp truy xuất bên ngoài trên các benchmark QA.

Đọc thêm: https://openreview.net/forum?id=qTsU1QLOph

6. FACT: Xem xét hiệu quả của việc viết lại ngữ cảnh lặp lại cho truy xuất đa sự kiện

Tóm tắt

Các Mô hình Ngôn ngữ Lớn (LLM) rất mạnh trong việc truy xuất từng sự kiện đơn lẻ từ ngữ cảnh dài nhưng gặp khó khăn khi cần truy xuất đồng thời nhiều sự kiện. Một hạn chế quan trọng được quan sát thấy là hiện tượng “lost-in-the-middle”, khi LLM dần mất dấu thông tin quan trọng trong quá trình sinh, dẫn đến đầu ra không đầy đủ hoặc không chính xác.

Để giải quyết vấn đề này, các tác giả đề xuất Find All Crucial Texts (FACT) — một phương pháp viết lại ngữ cảnh lặp lại giúp tinh chỉnh đầu vào một cách dần dần, cho phép mô hình nắm bắt các sự kiện quan trọng từng bước một.

Đóng góp chính

  • Xác định và phân tích hiện tượng “lost-in-the-middle” trong truy xuất đa sự kiện.

  • Giới thiệu FACT, một phương pháp truy xuất và viết lại lặp lại giúp cải thiện phạm vi bao phủ sự kiện theo từng bước.

  • Chứng minh mức tăng hiệu năng đáng kể trong các benchmark truy xuất đa sự kiện, dù mức cải thiện nhỏ hơn trên các tác vụ QA tổng quát.

  • Nhấn mạnh nhu cầu về các chiến lược mạnh mẽ hơn cho truy xuất ngữ cảnh dài.

Đọc thêm: https://arxiv.org/abs/2410.21012

7. SELA: Các Agent LLM tăng cường tìm kiếm cây cho học máy tự động

Tóm tắt

Các agent AutoML dựa trên LLM thường tạo ra các pipeline có độ đa dạng thấp và chưa tối ưu. SELA tận dụng Monte Carlo Tree Search (MCTS) để tối ưu hóa việc ra quyết định của agent và khám phá pipeline.

Đóng góp chính

  • Áp dụng các phương pháp tìm kiếm cây để cải thiện quá trình khám phá AutoML.

  • Tinh chỉnh lặp lại các pipeline bằng phản hồi thực nghiệm.

  • Vượt trội hơn các baseline AutoML truyền thống và dựa trên agent trên 20 bộ dữ liệu.

Đọc thêm: https://arxiv.org/abs/2410.17238

8. AFlow: Tự động hóa việc tạo quy trình làm việc dạng agent

Tóm tắt

Việc xây dựng các quy trình làm việc dạng agent cho LLM tốn nhiều công sức và chưa được tự động hóa بالكامل. AFlow tái định nghĩa tối ưu hóa quy trình làm việc thành một bài toán tìm kiếm trên đồ thị mã, sử dụng MCTS để tinh chỉnh lặp lại các quy trình làm việc với phản hồi thực thi.

Đóng góp chính

  • Định nghĩa tối ưu hóa quy trình làm việc như tìm kiếm trên đồ thị mã.

  • Cho phép các mô hình nhỏ hơn vượt qua GPT-4o với chỉ một phần nhỏ chi phí.

  • Đạt mức cải thiện 5.7% so với các baseline tiên tiến nhất.

Đọc thêm: https://arxiv.org/abs/2410.10762

9. Data Interpreter: Một Agent LLM cho khoa học dữ liệu

Tóm tắt

Các phương pháp hiện có gặp khó khăn với quy trình làm việc khoa học dữ liệu đầu-cuối, sự phụ thuộc tác vụ động và các yêu cầu về chuyên môn lĩnh vực.

Data Interpreter giới thiệu:

  • Mô hình hóa đồ thị phân cấp: chia nhỏ vấn đề thành các bài toán con với các nút động.

  • Tạo nút có thể lập trình: tinh chỉnh và xác thực mã lặp lại để tăng độ bền vững.

Đóng góp chính

  • Agent LLM đầu tiên được thiết kế riêng cho các quy trình làm việc khoa học dữ liệu đầy đủ.

  • Đạt mức cải thiện độ chính xác 25% trên InfiAgent-DABench.

  • Tăng đáng kể hiệu năng trên học máy, các tác vụ mở và bộ dữ liệu MATH.

Đọc thêm: https://arxiv.org/abs/2402.18679

10. MetaGPT: Lập trình meta cho một framework cộng tác đa Agent

Tóm tắt

Các hệ thống đa Agent dựa trên LLM thường thất bại trong các tác vụ phức tạp do ảo giác dây chuyền. MetaGPT mã hóa Quy trình vận hành tiêu chuẩn (SOP) vào các chuỗi câu lệnh, giúp tinh gọn quy trình làm việc và giảm lỗi.

Đóng góp chính

  • Giới thiệu lập trình meta cho cộng tác đa Agent.

  • Tích hợp các quy trình làm việc của con người dựa trên SOP vào câu lệnh của agent.

  • Cho phép phân công vai trò và phân rã tác vụ hiệu quả.

  • Chứng minh độ ổn định và độ chính xác vượt trội trong các tác vụ kỹ thuật phần mềm cộng tác.

Đọc thêm: https://arxiv.org/abs/2308.00352

Trang này có hữu ích không?

Bài viết liên quan