Доступ к академическим ресурсам
Научные статьи и академические ресурсы, лежащие в основе возможностей Atoms в области мультиагентности, рассуждения и рабочих процессов.
Atoms сотрудничает с ведущими университетами и исследовательскими институтами по всему миру, создавая передовые исследования в области мультиагентных фреймворков, рассуждения LLM, расширения контекста и автоматизированных рабочих процессов.
Эти работы не только продвигают теоретический прогресс, но и усиливают возможности продукта Atoms в таких областях, как мультиагентное взаимодействие, интерпретация данных, RAG-усиленное рассуждение и оптимизация промптов.
1. You Don’t Know Until You Click: Automated GUI Testing for Production-Ready Software Evaluation
Аннотация
По мере того как большие языковые модели (LLM) и кодовые агенты переходят от генерации отдельных фрагментов к созданию полноценных приложений с GUI, интерактивной логикой и динамическим поведением, существующие бенчмарки не позволяют эффективно оценивать программное обеспечение, готовое к использованию в продакшене. Статические проверки или бинарные сценарии pass/fail упускают реальную удобство использования, которое проявляется только во взаимодействии.
Чтобы решить эту проблему, авторы представляют RealDevWorld — сквозной автоматизированный фреймворк оценки для тестирования способности LLM создавать с нуля репозитории, готовые к использованию в продакшене.
Ключевые результаты
Первый сквозной фреймворк оценки на основе GUI для приложений, готовых к использованию в продакшене.
Представлен RealDevBench — бенчмарк из 194 разнообразных мультимодальных инженерных задач.
Предложен AppEvalPilot — система agent-as-a-judge, имитирующая взаимодействия пользователей через GUI для целостной оценки.
Достигнуто высокое соответствие человеческой оценке (точность 0.92, корреляция 0.85) при снижении зависимости от ручной проверки.
Подробнее: https://arxiv.org/abs/2508.14104
2. Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems
Аннотация
Появление LLM стало катализатором преобразующего сдвига в ИИ, сделав возможными интеллектуальных агентов, способных к рассуждению, восприятию и действию в различных областях. Проектирование, оценка и непрерывное совершенствование таких агентов сопряжены с многогранными трудностями.
Этот обзор дает всестороннее представление о Foundation Agents, рассматриваемых через призму вдохновленных мозгом модульных архитектур, которые объединяют идеи когнитивной науки, нейронауки и вычислений.
Ключевые результаты
Предлагается модульный фреймворк, сопоставляющий компоненты агента с функциями мозга (память, моделирование, цели, эмоции).
Исследуются самосовершенствование и непрерывная адаптация через эволюционные механизмы.
Рассматриваются мультиагентные системы и возникающий коллективный интеллект.
Затрагиваются вопросы безопасности, устойчивости и согласованности при развертывании в реальном мире.
Подробнее: https://arxiv.org/abs/2504.01990
3. Atom of Thoughts for Markov LLM Test-Time Scaling
Аннотация
LLM выигрывают от масштабирования во время обучения, а test-time scaling дополнительно усиливает рассуждение. Однако накопленный исторический контекст может впустую расходовать вычислительные ресурсы и мешать рассуждению.
В статье представлен Atom of Thoughts (AoT), который разбивает сложное рассуждение на атомарные, не зависящие от памяти подвопросы, формируя марковоподобный процесс рассуждения.
Ключевые результаты
Определяется атомарное рассуждение: разбиение вопросов на подзадачи DAG и их свертывание.
Обеспечивается совместимость в виде plug-in для существующих методов test-time scaling.
Повышается эффективность за счет сокращения избыточности контекста и вычислительных потерь.
Демонстрируется значительный прирост производительности на шести бенчмарках.
Подробнее: https://arxiv.org/abs/2502.12018
4. Self-Supervised Промпт Optimization (SPO)
Аннотация
Высококачественные промпты критически важны для улучшения рассуждения LLM, однако ручная разработка промптов требует экспертизы и множества итераций. Существующие автоматизированные методы сильно зависят от размеченных эталонов, что ограничивает их применимость в реальных условиях.
SPO представляет самоконтролируемый фреймворк, который находит эффективные промпты как для задач с закрытым, так и с открытым типом ответа без внешних эталонов.
Ключевые результаты
Самоконтролируемые сигналы извлекаются исключительно из выходов LLM.
LLM используются одновременно как оценщик и оптимизатор.
Достигается уровень state-of-the-art при 1–5% от стоимости традиционных методов.
Подробнее: https://arxiv.org/abs/2502.06855
5. Improving Context Fidelity via Native Retrieval-Augmented Reasoning (CARE)
Аннотация
LLM часто выдают галлюцинации, то есть ответы, не согласующиеся с заданным контекстом. Традиционные решения либо требуют дорогих размеченных датасетов, либо полагаются на внешнее извлечение, которое недостаточно использует предоставленный пользователем контекст.
CARE представляет фреймворк native retrieval-augmented reasoning, в котором LLM динамически интегрируют внутриконтекстные доказательства непосредственно в цепочку рассуждения.
Ключевые результаты
Внутриконтекстное извлечение вводится как часть процесса рассуждения.
Требуется минимальный объем размеченных данных, а для сложных задач используется curriculum learning.
Метод превосходит SFT, традиционный RAG и методы внешнего извлечения на QA-бенчмарках.
Подробнее: https://openreview.net/forum?id=qTsU1QLOph
6. FACT: Examining the Effectiveness of Iterative Context Rewriting for Multi-fact Retrieval
Аннотация
Большие языковые модели (LLM) хорошо справляются с извлечением отдельных фактов из длинных контекстов, но испытывают трудности, когда необходимо одновременно извлечь несколько фактов. Одним из ключевых ограничений является феномен “lost-in-the-middle”, при котором LLM постепенно теряют из виду важную информацию в процессе генерации, что приводит к неполным или неточным результатам.
Чтобы решить эту проблему, авторы предлагают Find All Crucial Texts (FACT) — метод итеративного переписывания контекста, который постепенно уточняет входные данные, позволяя модели шаг за шагом фиксировать критически важные факты.
Ключевые результаты
Выявляется и анализируется феномен “lost-in-the-middle” при извлечении нескольких фактов.
Представлен FACT — итеративный подход к извлечению и переписыванию, который поэтапно улучшает полноту охвата фактов.
Продемонстрирован значительный прирост качества на бенчмарках по извлечению нескольких фактов, хотя на общих QA-задачах улучшения меньше.
Подчеркивается необходимость более устойчивых стратегий для извлечения в длинном контексте.
Подробнее: https://arxiv.org/abs/2410.21012
7. SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning
Аннотация
LLM-основанные AutoML-агенты часто создают малоразнообразные и неоптимальные пайплайны. SELA использует Monte Carlo Tree Search (MCTS) для оптимизации принятия решений агентом и исследования пайплайнов.
Ключевые результаты
Методы поиска по дереву применяются для улучшения исследования в AutoML.
Пайплайны итеративно улучшаются с учетом экспериментальной обратной связи.
Метод превосходит традиционные и агентные AutoML-бейзлайны на 20 датасетах.
Подробнее: https://arxiv.org/abs/2410.17238
8. AFlow: Automating Agentic Workflow Generation
Аннотация
Построение агентных рабочих процессов для LLM требует больших трудозатрат и пока не является полностью автоматизированным. AFlow переосмысляет оптимизацию рабочих процессов как задачу поиска по графам кода, используя MCTS для итеративного улучшения рабочих процессов с учетом обратной связи от выполнения.
Ключевые результаты
Оптимизация рабочих процессов определяется как поиск по графу кода.
Позволяет меньшим моделям превосходить GPT-4o при гораздо меньшей стоимости.
Достигается улучшение на 5.7% по сравнению с бейзлайнами уровня state-of-the-art.
Подробнее: https://arxiv.org/abs/2410.10762
9. Data Interpreter: An LLM Agent For Data Science
Аннотация
Существующие подходы испытывают трудности со сквозными рабочими процессами data science, динамическими зависимостями задач и требованиями к предметной экспертизе.
Data Interpreter представляет:
Иерархическое моделирование графов: разбивает проблемы на подзадачи с динамическими узлами.
Программируемую генерацию узлов: итеративно уточняет и валидирует код для повышения устойчивости.
Ключевые результаты
Первый LLM-агент, адаптированный для полноценных рабочих процессов data science.
Достигается повышение точности на 25% на InfiAgent-DABench.
Значительно улучшается качество на задачах машинного обучения, открытых задачах и датасете MATH.
Подробнее: https://arxiv.org/abs/2402.18679
10. MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework
Аннотация
Мультиагентные системы на основе LLM часто терпят неудачу на сложных задачах из-за каскадных галлюцинаций. MetaGPT кодирует Standard Operating Procedures (SOPs) в последовательности промптов, упрощая рабочие процессы и снижая количество ошибок.
Ключевые результаты
Представлен подход метапрограммирования для мультиагентного взаимодействия.
В промпты агентов внедряются человеческие рабочие процессы на основе SOP.
Обеспечиваются эффективное распределение ролей и декомпозиция задач.
Демонстрируются превосходящие стабильность и точность в совместных задачах программной инженерии.
Подробнее: https://arxiv.org/abs/2308.00352