Atoms
Советы и руководства

Доступ к академическим ресурсам

Научные статьи и академические ресурсы, лежащие в основе возможностей Atoms в области мультиагентности, рассуждения и рабочих процессов.

Atoms сотрудничает с ведущими университетами и исследовательскими институтами по всему миру, создавая передовые исследования в области мультиагентных фреймворков, рассуждения LLM, расширения контекста и автоматизированных рабочих процессов.

Эти работы не только продвигают теоретический прогресс, но и усиливают возможности продукта Atoms в таких областях, как мультиагентное взаимодействие, интерпретация данных, RAG-усиленное рассуждение и оптимизация промптов.

1. You Don’t Know Until You Click: Automated GUI Testing for Production-Ready Software Evaluation

Аннотация

По мере того как большие языковые модели (LLM) и кодовые агенты переходят от генерации отдельных фрагментов к созданию полноценных приложений с GUI, интерактивной логикой и динамическим поведением, существующие бенчмарки не позволяют эффективно оценивать программное обеспечение, готовое к использованию в продакшене. Статические проверки или бинарные сценарии pass/fail упускают реальную удобство использования, которое проявляется только во взаимодействии.

Чтобы решить эту проблему, авторы представляют RealDevWorld — сквозной автоматизированный фреймворк оценки для тестирования способности LLM создавать с нуля репозитории, готовые к использованию в продакшене.

Ключевые результаты

  • Первый сквозной фреймворк оценки на основе GUI для приложений, готовых к использованию в продакшене.

  • Представлен RealDevBench — бенчмарк из 194 разнообразных мультимодальных инженерных задач.

  • Предложен AppEvalPilot — система agent-as-a-judge, имитирующая взаимодействия пользователей через GUI для целостной оценки.

  • Достигнуто высокое соответствие человеческой оценке (точность 0.92, корреляция 0.85) при снижении зависимости от ручной проверки.

Подробнее: https://arxiv.org/abs/2508.14104

2. Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems

Аннотация

Появление LLM стало катализатором преобразующего сдвига в ИИ, сделав возможными интеллектуальных агентов, способных к рассуждению, восприятию и действию в различных областях. Проектирование, оценка и непрерывное совершенствование таких агентов сопряжены с многогранными трудностями.

Этот обзор дает всестороннее представление о Foundation Agents, рассматриваемых через призму вдохновленных мозгом модульных архитектур, которые объединяют идеи когнитивной науки, нейронауки и вычислений.

Ключевые результаты

  • Предлагается модульный фреймворк, сопоставляющий компоненты агента с функциями мозга (память, моделирование, цели, эмоции).

  • Исследуются самосовершенствование и непрерывная адаптация через эволюционные механизмы.

  • Рассматриваются мультиагентные системы и возникающий коллективный интеллект.

  • Затрагиваются вопросы безопасности, устойчивости и согласованности при развертывании в реальном мире.

Подробнее: https://arxiv.org/abs/2504.01990

3. Atom of Thoughts for Markov LLM Test-Time Scaling

Аннотация

LLM выигрывают от масштабирования во время обучения, а test-time scaling дополнительно усиливает рассуждение. Однако накопленный исторический контекст может впустую расходовать вычислительные ресурсы и мешать рассуждению.

В статье представлен Atom of Thoughts (AoT), который разбивает сложное рассуждение на атомарные, не зависящие от памяти подвопросы, формируя марковоподобный процесс рассуждения.

Ключевые результаты

  • Определяется атомарное рассуждение: разбиение вопросов на подзадачи DAG и их свертывание.

  • Обеспечивается совместимость в виде plug-in для существующих методов test-time scaling.

  • Повышается эффективность за счет сокращения избыточности контекста и вычислительных потерь.

  • Демонстрируется значительный прирост производительности на шести бенчмарках.

Подробнее: https://arxiv.org/abs/2502.12018

4. Self-Supervised Промпт Optimization (SPO)

Аннотация

Высококачественные промпты критически важны для улучшения рассуждения LLM, однако ручная разработка промптов требует экспертизы и множества итераций. Существующие автоматизированные методы сильно зависят от размеченных эталонов, что ограничивает их применимость в реальных условиях.

SPO представляет самоконтролируемый фреймворк, который находит эффективные промпты как для задач с закрытым, так и с открытым типом ответа без внешних эталонов.

Ключевые результаты

  • Самоконтролируемые сигналы извлекаются исключительно из выходов LLM.

  • LLM используются одновременно как оценщик и оптимизатор.

  • Достигается уровень state-of-the-art при 1–5% от стоимости традиционных методов.

Подробнее: https://arxiv.org/abs/2502.06855

5. Improving Context Fidelity via Native Retrieval-Augmented Reasoning (CARE)

Аннотация

LLM часто выдают галлюцинации, то есть ответы, не согласующиеся с заданным контекстом. Традиционные решения либо требуют дорогих размеченных датасетов, либо полагаются на внешнее извлечение, которое недостаточно использует предоставленный пользователем контекст.

CARE представляет фреймворк native retrieval-augmented reasoning, в котором LLM динамически интегрируют внутриконтекстные доказательства непосредственно в цепочку рассуждения.

Ключевые результаты

  • Внутриконтекстное извлечение вводится как часть процесса рассуждения.

  • Требуется минимальный объем размеченных данных, а для сложных задач используется curriculum learning.

  • Метод превосходит SFT, традиционный RAG и методы внешнего извлечения на QA-бенчмарках.

Подробнее: https://openreview.net/forum?id=qTsU1QLOph

6. FACT: Examining the Effectiveness of Iterative Context Rewriting for Multi-fact Retrieval

Аннотация

Большие языковые модели (LLM) хорошо справляются с извлечением отдельных фактов из длинных контекстов, но испытывают трудности, когда необходимо одновременно извлечь несколько фактов. Одним из ключевых ограничений является феномен “lost-in-the-middle”, при котором LLM постепенно теряют из виду важную информацию в процессе генерации, что приводит к неполным или неточным результатам.

Чтобы решить эту проблему, авторы предлагают Find All Crucial Texts (FACT)метод итеративного переписывания контекста, который постепенно уточняет входные данные, позволяя модели шаг за шагом фиксировать критически важные факты.

Ключевые результаты

  • Выявляется и анализируется феномен “lost-in-the-middle” при извлечении нескольких фактов.

  • Представлен FACT — итеративный подход к извлечению и переписыванию, который поэтапно улучшает полноту охвата фактов.

  • Продемонстрирован значительный прирост качества на бенчмарках по извлечению нескольких фактов, хотя на общих QA-задачах улучшения меньше.

  • Подчеркивается необходимость более устойчивых стратегий для извлечения в длинном контексте.

Подробнее: https://arxiv.org/abs/2410.21012

7. SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning

Аннотация

LLM-основанные AutoML-агенты часто создают малоразнообразные и неоптимальные пайплайны. SELA использует Monte Carlo Tree Search (MCTS) для оптимизации принятия решений агентом и исследования пайплайнов.

Ключевые результаты

  • Методы поиска по дереву применяются для улучшения исследования в AutoML.

  • Пайплайны итеративно улучшаются с учетом экспериментальной обратной связи.

  • Метод превосходит традиционные и агентные AutoML-бейзлайны на 20 датасетах.

Подробнее: https://arxiv.org/abs/2410.17238

8. AFlow: Automating Agentic Workflow Generation

Аннотация

Построение агентных рабочих процессов для LLM требует больших трудозатрат и пока не является полностью автоматизированным. AFlow переосмысляет оптимизацию рабочих процессов как задачу поиска по графам кода, используя MCTS для итеративного улучшения рабочих процессов с учетом обратной связи от выполнения.

Ключевые результаты

  • Оптимизация рабочих процессов определяется как поиск по графу кода.

  • Позволяет меньшим моделям превосходить GPT-4o при гораздо меньшей стоимости.

  • Достигается улучшение на 5.7% по сравнению с бейзлайнами уровня state-of-the-art.

Подробнее: https://arxiv.org/abs/2410.10762

9. Data Interpreter: An LLM Agent For Data Science

Аннотация

Существующие подходы испытывают трудности со сквозными рабочими процессами data science, динамическими зависимостями задач и требованиями к предметной экспертизе.

Data Interpreter представляет:

  • Иерархическое моделирование графов: разбивает проблемы на подзадачи с динамическими узлами.

  • Программируемую генерацию узлов: итеративно уточняет и валидирует код для повышения устойчивости.

Ключевые результаты

  • Первый LLM-агент, адаптированный для полноценных рабочих процессов data science.

  • Достигается повышение точности на 25% на InfiAgent-DABench.

  • Значительно улучшается качество на задачах машинного обучения, открытых задачах и датасете MATH.

Подробнее: https://arxiv.org/abs/2402.18679

10. MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework

Аннотация

Мультиагентные системы на основе LLM часто терпят неудачу на сложных задачах из-за каскадных галлюцинаций. MetaGPT кодирует Standard Operating Procedures (SOPs) в последовательности промптов, упрощая рабочие процессы и снижая количество ошибок.

Ключевые результаты

  • Представлен подход метапрограммирования для мультиагентного взаимодействия.

  • В промпты агентов внедряются человеческие рабочие процессы на основе SOP.

  • Обеспечиваются эффективное распределение ролей и декомпозиция задач.

  • Демонстрируются превосходящие стабильность и точность в совместных задачах программной инженерии.

Подробнее: https://arxiv.org/abs/2308.00352

Была ли эта страница полезной?

Связанные статьи