الوصول إلى الموارد الأكاديمية
أوراق بحثية وموارد أكاديمية تقف وراء قدرات Atoms في تعدد الوكلاء، والاستدلال، وسير العمل.
تتعاون Atoms مع أبرز الجامعات ومعاهد الأبحاث حول العالم، وتنتج أبحاثًا متقدمة في أطر العمل متعددة الوكلاء، واستدلال LLM، وتعزيز السياق، وسير العمل المؤتمت.
لا تقتصر هذه الأعمال على دفع التقدم النظري إلى الأمام فحسب، بل تعزز أيضًا قدرات منتجات Atoms في مجالات مثل التعاون متعدد الوكلاء، وتفسير البيانات، والاستدلال المعزز بـ RAG، وتحسين Prompt.
1. أنت لا تعرف حتى تنقر: اختبار GUI المؤتمت لتقييم البرمجيات الجاهزة للإنتاج
الملخص
مع تطور نماذج اللغة الكبيرة (LLMs) ووكلاء البرمجة من توليد مقاطع منفصلة إلى بناء تطبيقات كاملة بواجهات GUI ومنطق تفاعلي وسلوكيات ديناميكية، تفشل المعايير الحالية في تقييم البرمجيات الجاهزة للإنتاج بفعالية. فعمليات التحقق الثابتة أو نصوص النجاح/الفشل الثنائية تتجاهل قابلية الاستخدام في العالم الواقعي، والتي لا تظهر إلا من خلال التفاعل.
ولمعالجة ذلك، يقدم المؤلفون RealDevWorld، وهو إطار تقييم مؤتمت شامل لاختبار قدرة LLMs على إنشاء مستودعات جاهزة للإنتاج من الصفر.
المساهمات الرئيسية
أول إطار تقييم شامل قائم على GUI للتطبيقات الجاهزة للإنتاج.
تقديم RealDevBench، وهو معيار يتضمن 194 مهمة هندسية متعددة الوسائط ومتنوعة.
اقتراح AppEvalPilot، وهو نظام وكيل-كحكم يحاكي تفاعلات المستخدم المعتمدة على GUI لإجراء تقييم شامل.
تحقيق توافق مرتفع مع التقييم البشري (دقة 0.92، ارتباط 0.85) مع تقليل الاعتماد على المراجعة اليدوية.
اقرأ المزيد: https://arxiv.org/abs/2508.14104
2. التطورات والتحديات في Foundation Agents: من الذكاء المستلهم من الدماغ إلى الأنظمة التطورية والتعاونية والآمنة
الملخص
أدى ظهور LLMs إلى إحداث تحول جذري في الذكاء الاصطناعي، مما أتاح وكلاء أذكياء قادرين على الاستدلال والإدراك واتخاذ الإجراءات عبر مجالات متعددة. ويمثل تصميم هؤلاء الوكلاء وتقييمهم وتحسينهم المستمر تحديات متعددة الأوجه.
تقدم هذه الدراسة الاستقصائية نظرة شاملة على Foundation Agents، في إطار معماريات معيارية مستلهمة من الدماغ تدمج رؤى من العلوم المعرفية وعلوم الأعصاب والحوسبة.
المساهمات الرئيسية
تقترح إطارًا معياريًا يربط مكونات الوكيل بوظائف الدماغ (الذاكرة، والنمذجة، والأهداف، والعواطف).
تستكشف التحسين الذاتي والتكيف المستمر من خلال الآليات التطورية.
تدرس الأنظمة متعددة الوكلاء والذكاء الجماعي الناشئ.
تتناول تحديات السلامة والصلابة والمواءمة في النشر الواقعي.
اقرأ المزيد: https://arxiv.org/abs/2504.01990
3. Atom of Thoughts لتوسيع وقت الاختبار Markov LLM
الملخص
تستفيد LLMs من التوسيع أثناء التدريب، كما أن التوسيع وقت الاختبار يعزز الاستدلال بشكل أكبر. ومع ذلك، فإن السياق التاريخي المتراكم قد يهدر القدرة الحاسوبية ويعيق الاستدلال.
تقدم الورقة Atom of Thoughts (AoT)، الذي يفكك الاستدلال المعقد إلى أسئلة فرعية ذرية بلا ذاكرة، مشكلًا عملية استدلال شبيهة بـ Markov.
المساهمات الرئيسية
يعرّف الاستدلال الذري: تفكيك الأسئلة إلى مسائل فرعية في DAG ثم دمجها.
يوفر توافقًا كمكوّن إضافي لأساليب التوسيع وقت الاختبار الحالية.
يحسن الكفاءة عبر تقليل تكرار السياق والهدر الحاسوبي.
يبرهن على مكاسب كبيرة في الأداء عبر ستة معايير.
اقرأ المزيد: https://arxiv.org/abs/2502.12018
4. التحسين الذاتي الإشراف لـ Prompt (SPO)
الملخص
تُعد Prompts عالية الجودة ضرورية لتعزيز استدلال LLM، لكن التصميم اليدوي لـ Prompt يتطلب خبرة وتكرارًا. وتعتمد الأساليب المؤتمتة الحالية بشكل كبير على مراجع معنونة، مما يحد من قابليتها للتطبيق في العالم الواقعي.
يقدم SPO إطارًا ذاتي الإشراف يكتشف Prompts فعالة لكل من المهام المغلقة والمفتوحة دون مراجع خارجية.
المساهمات الرئيسية
إشارات ذاتية الإشراف مستمدة بالكامل من مخرجات LLM.
يستخدم LLMs بصفتهما المقيّم والمُحسِّن في آن واحد.
يحقق أداءً على أحدث مستوى باستخدام 1–5% من تكلفة الأساليب التقليدية.
اقرأ المزيد: https://arxiv.org/abs/2502.06855
5. تحسين موثوقية السياق عبر الاستدلال الأصلي المعزز بالاسترجاع (CARE)
الملخص
غالبًا ما تقدم LLMs إجابات تنطوي على هلوسة ولا تتسق مع السياق المعطى. وتتطلب الحلول التقليدية إما مجموعات بيانات إشرافية مكلفة أو تعتمد على استرجاع خارجي لا يستفيد بما يكفي من السياق الذي يقدمه المستخدم.
يقدم CARE إطار استدلال أصلي معزز بالاسترجاع تدمج فيه LLMs الأدلة داخل السياق بشكل ديناميكي مباشرةً في سلسلة الاستدلال.
المساهمات الرئيسية
يقدم الاسترجاع داخل السياق كجزء من عملية الاستدلال.
يتطلب حدًا أدنى من البيانات المعنونة ويستخدم التعلم المتدرج للمهام المعقدة.
يتفوق على SFT وRAG التقليدي وطرق الاسترجاع الخارجي في معايير الأسئلة والأجوبة.
اقرأ المزيد: https://openreview.net/forum?id=qTsU1QLOph
6. FACT: دراسة فعالية إعادة كتابة السياق التكرارية لاسترجاع حقائق متعددة
الملخص
تتمتع نماذج اللغة الكبيرة (LLMs) بقدرة قوية على استرجاع حقيقة واحدة من سياقات طويلة، لكنها تواجه صعوبة عندما يجب استرجاع حقائق متعددة في الوقت نفسه. وأحد القيود الرئيسية الملحوظة هو "ظاهرة الضياع في المنتصف"، حيث تفقد LLMs تدريجيًا تتبع المعلومات المهمة أثناء التوليد، ما يؤدي إلى مخرجات غير مكتملة أو غير دقيقة.
ولمعالجة ذلك، يقترح المؤلفون Find All Crucial Texts (FACT) — وهي طريقة تكرارية لإعادة كتابة السياق تعمل على تحسين المدخلات تدريجيًا، مما يسمح للنموذج بالتقاط الحقائق الحاسمة خطوة بخطوة.
المساهمات الرئيسية
يحدد ويحلل ظاهرة "الضياع في المنتصف" في استرجاع الحقائق المتعددة.
يقدم FACT، وهو نهج تكراري للاسترجاع وإعادة الكتابة يحسن التغطية الواقعية بشكل تدريجي.
يبرهن على مكاسب كبيرة في الأداء في معايير استرجاع الحقائق المتعددة، وإن كانت التحسينات أقل في مهام الأسئلة والأجوبة العامة.
يسلط الضوء على الحاجة إلى استراتيجيات أكثر صلابة في استرجاع السياقات الطويلة.
اقرأ المزيد: https://arxiv.org/abs/2410.21012
7. SELA: وكلاء LLM معززون بالبحث الشجري للتعلم الآلي المؤتمت
الملخص
غالبًا ما تُنشئ وكلاء AutoML المعتمدون على LLM خطوط معالجة منخفضة التنوع وغير مثالية. ويستفيد SELA من بحث شجرة مونت كارلو (MCTS) لتحسين اتخاذ القرار لدى الوكيل واستكشاف خطوط المعالجة.
المساهمات الرئيسية
يطبق أساليب البحث الشجري لتحسين استكشاف AutoML.
يحسن خطوط المعالجة تكراريًا بالاعتماد على التغذية الراجعة التجريبية.
يتفوق على خطوط الأساس التقليدية وتلك المعتمدة على الوكلاء في AutoML عبر 20 مجموعة بيانات.
اقرأ المزيد: https://arxiv.org/abs/2410.17238
8. AFlow: أتمتة إنشاء سير العمل القائم على الوكلاء
الملخص
إن إنشاء سير عمل قائم على الوكلاء لـ LLMs يتطلب جهدًا كبيرًا ولم تتم أتمتته بالكامل. يعيد AFlow صياغة تحسين سير العمل على أنه مشكلة بحث عبر رسوم بيانية برمجية، باستخدام MCTS لتحسين سير العمل تكراريًا عبر تغذية راجعة من التنفيذ.
المساهمات الرئيسية
يعرّف تحسين سير العمل بوصفه بحثًا في الرسوم البيانية البرمجية.
يمكّن النماذج الأصغر من التفوق على GPT-4o بجزء بسيط من التكلفة.
يحقق تحسنًا بنسبة 5.7% مقارنة بخطوط الأساس المتقدمة.
اقرأ المزيد: https://arxiv.org/abs/2410.10762
9. Data Interpreter: وكيل LLM لعلم البيانات
الملخص
تواجه الأساليب الحالية صعوبة في التعامل مع سير عمل علم البيانات الشامل، واعتماديات المهام الديناميكية، ومتطلبات الخبرة المجالّية.
يقدم Data Interpreter:
النمذجة البيانية الهرمية: تقسيم المشكلات إلى مشكلات فرعية بعُقد ديناميكية.
إنشاء العُقد القابل للبرمجة: تحسين الكود والتحقق منه تكراريًا من أجل الصلابة.
المساهمات الرئيسية
أول وكيل LLM مُصمم خصيصًا لسير عمل علم البيانات الكامل.
يحقق تحسنًا في الدقة بنسبة 25% على InfiAgent-DABench.
يعزز أداء التعلم الآلي، والمهام المفتوحة، ومجموعة بيانات MATH بشكل ملحوظ.
اقرأ المزيد: https://arxiv.org/abs/2402.18679
10. MetaGPT: البرمجة الوصفية لإطار تعاوني متعدد الوكلاء
الملخص
غالبًا ما تفشل الأنظمة متعددة الوكلاء المعتمدة على LLM في المهام المعقدة بسبب تتابع حالات هلوسة. يقوم MetaGPT بترميز إجراءات التشغيل القياسية (SOPs) ضمن تسلسلات Prompt، مما يبسط سير العمل ويقلل الأخطاء.
المساهمات الرئيسية
يقدم البرمجة الوصفية للتعاون متعدد الوكلاء.
يدمج سير العمل البشري القائم على SOP في Prompts الوكلاء.
يتيح إسناد الأدوار وتفكيك المهام بكفاءة.
يبرهن على استقرار ودقة متفوقين في مهام هندسة البرمجيات التعاونية.
اقرأ المزيد: https://arxiv.org/abs/2308.00352