Atoms
İpuçları ve Öğreticiler

Akademik Kaynaklara Erişin

Atoms’un çoklu agent, akıl yürütme ve iş akışı yeteneklerinin arkasındaki araştırma makaleleri ve akademik kaynaklar.

Atoms, dünya çapındaki önde gelen üniversiteler ve araştırma enstitüleriyle iş birliği yaparak çoklu agent çerçeveleri, LLM akıl yürütmesi, bağlam zenginleştirme ve otomatik iş akışları üzerine en ileri düzey araştırmalar üretmektedir.

Bu çalışmalar yalnızca teorik ilerlemeyi ileri taşımakla kalmaz, aynı zamanda çoklu agent iş birliği, veri yorumlama, RAG ile geliştirilmiş akıl yürütme ve istem optimizasyonu gibi alanlarda Atoms’un ürün yeteneklerini de güçlendirir.

1. Tıklayana Kadar Bilemezsin: Üretime Hazır Yazılım Değerlendirmesi için Otomatik GUI Testi

Özet

Büyük dil modelleri (LLM'ler) ve kod agent’ları, izole kod parçacıkları üretmekten GUI’lere, etkileşimli mantığa ve dinamik davranışlara sahip tam uygulamalar oluşturmaya doğru evrilirken, mevcut kıyaslamalar üretime hazır yazılımı etkili biçimde değerlendirmekte yetersiz kalmaktadır. Statik kontroller veya ikili geçti/kaldı betikleri, yalnızca etkileşim yoluyla ortaya çıkan gerçek dünya kullanılabilirliğini gözden kaçırır.

Bunu ele almak için yazarlar, LLM’lerin sıfırdan üretime hazır repository’ler oluşturma yeteneğini test eden uçtan uca otomatik bir değerlendirme çerçevesi olan RealDevWorld'ü tanıtmaktadır.

Temel Katkılar

  • Üretime hazır uygulamalar için ilk GUI tabanlı uçtan uca değerlendirme çerçevesi.

  • 194 farklı çok modlu mühendislik görevinden oluşan bir benchmark olan RealDevBench tanıtıldı.

  • Bütünsel değerlendirme için GUI tabanlı kullanıcı etkileşimlerini simüle eden, hakem olarak agent sistemi AppEvalPilot önerildi.

  • Manuel incelemeye olan bağımlılığı azaltırken yüksek insan uyumu sağlandı (doğruluk 0.92, korelasyon 0.85).

Daha fazla bilgi: https://arxiv.org/abs/2508.14104

2. Foundation Agents Alanındaki İlerlemeler ve Zorluklar: Beyinden İlham Alan Zekadan Evrimsel, İş Birlikçi ve Güvenli Sistemlere

Özet

LLM’lerin ortaya çıkışı, alanlar arasında akıl yürütebilen, algılayabilen ve eylemde bulunabilen akıllı agent’ları mümkün kılarak yapay zekada dönüştürücü bir değişimi tetiklemiştir. Bu tür agent’ları tasarlamak, değerlendirmek ve sürekli iyileştirmek çok yönlü zorluklar barındırır.

Bu derleme, bilişsel bilim, sinirbilim ve hesaplamadan gelen içgörüleri birleştiren, beyinden ilham alan modüler mimariler çerçevesinde ele alınmış Foundation Agents için kapsamlı bir genel bakış sunmaktadır.

Temel Katkılar

  • Agent bileşenlerini beyin işlevleriyle (hafıza, modelleme, hedefler, duygular) eşleştiren modüler bir çerçeve önerir.

  • Evrimsel mekanizmalar yoluyla kendini geliştirme ve sürekli adaptasyonu inceler.

  • Çoklu agent sistemlerini ve ortaya çıkan kolektif zekayı ele alır.

  • Gerçek dünya dağıtımında güvenlik, sağlamlık ve uyum zorluklarına değinir.

Daha fazla bilgi: https://arxiv.org/abs/2504.01990

3. Markov LLM Test Zamanı Ölçeklendirmesi için Atom of Thoughts

Özet

LLM’ler eğitim sırasında ölçeklendirmeden fayda görür ve test zamanı ölçeklendirmesi akıl yürütmeyi daha da geliştirir. Ancak biriken tarihsel bağlam, hesaplamayı boşa harcayabilir ve akıl yürütmeyi engelleyebilir.

Makale, karmaşık akıl yürütmeyi atomik, hafızasız alt sorulara ayırarak Markov benzeri bir akıl yürütme süreci oluşturan Atom of Thoughts (AoT) yaklaşımını tanıtmaktadır.

Temel Katkılar

  • Atomik akıl yürütmeyi tanımlar: soruları DAG alt problemlere ayırmak ve bunları daraltmak.

  • Mevcut test zamanı ölçeklendirme yöntemleri için eklenti olarak uyumluluk sağlar.

  • Bağlam tekrarını ve hesaplama israfını azaltarak verimliliği artırır.

  • Altı benchmark genelinde önemli performans kazanımları gösterir.

Daha fazla bilgi: https://arxiv.org/abs/2502.12018

4. Self-Supervised İstem Optimization (SPO)

Özet

Yüksek kaliteli istemler, LLM akıl yürütmesini geliştirmek için kritik öneme sahiptir; ancak manuel istem tasarımı uzmanlık ve tekrar gerektirir. Mevcut otomatik yöntemler, etiketli referanslara büyük ölçüde dayanır ve bu da gerçek dünyadaki uygulanabilirliği sınırlar.

SPO, harici referanslar olmadan hem kapalı uçlu hem de açık uçlu görevler için etkili istemler keşfeden, kendi kendini denetleyen bir çerçeve sunar.

Temel Katkılar

  • Yalnızca LLM çıktılarından türetilen kendi kendini denetleyen sinyaller.

  • LLM’leri hem değerlendirici hem de optimize edici olarak kullanır.

  • Geleneksel yöntemlerin %1–5 maliyetiyle en ileri düzey performans elde eder.

Daha fazla bilgi: https://arxiv.org/abs/2502.06855

5. Native Retrieval-Augmented Reasoning (CARE) ile Bağlam Doğruluğunu İyileştirme

Özet

LLM’ler, verilen bağlamla tutarsız yanıtlar vererek sık sık halüsinasyon görür. Geleneksel çözümler ya pahalı denetimli veri kümeleri gerektirir ya da kullanıcı tarafından sağlanan bağlamı yeterince kullanmayan harici getirmeye dayanır.

CARE, LLM’lerin bağlam içi kanıtları doğrudan akıl yürütme zincirine dinamik olarak entegre ettiği yerel retrieval-augmented reasoning çerçevesini sunar.

Temel Katkılar

  • Akıl yürütme sürecinin bir parçası olarak bağlam içi getirmeyi tanıtır.

  • Minimum etiketli veri gerektirir ve karmaşık görevler için müfredat öğrenmesini kullanır.

  • QA benchmark’larında SFT, geleneksel RAG ve harici getirme yöntemlerinden daha iyi performans gösterir.

Daha fazla bilgi: https://openreview.net/forum?id=qTsU1QLOph

6. FACT: Çoklu Olgu Getirme için Yinelemeli Bağlam Yeniden Yazımının Etkililiğinin İncelenmesi

Özet

Büyük Dil Modelleri (LLM’ler), uzun bağlamlardan tekil olguları getirmede güçlüdür, ancak birden fazla olgunun eşzamanlı olarak getirilmesi gerektiğinde zorlanırlar. Gözlemlenen temel bir sınırlama, LLM’lerin üretim sırasında önemli bilgilerin izini giderek kaybettiği ve eksik ya da hatalı çıktılara yol açtığı “ortada kaybolma” olgusudur.

Bunu ele almak için yazarlar, modelin kritik olguları adım adım yakalamasına olanak tanıyan girdiyi aşamalı olarak rafine eden yinelemeli bir bağlam yeniden yazımı yöntemi olan Find All Crucial Texts (FACT) yaklaşımını önermektedir.

Temel Katkılar

  • Çoklu olgu getirmede “ortada kaybolma” olgusunu tanımlar ve analiz eder.

  • Olgusal kapsamı kademeli olarak iyileştiren yinelemeli bir getirme ve yeniden yazma yaklaşımı olan FACT'ı tanıtır.

  • Genel QA görevlerinde daha sınırlı iyileşmeler olsa da, çoklu olgu getirme benchmark’larında önemli performans artışları gösterir.

  • Uzun bağlam getirme için daha sağlam stratejilere duyulan ihtiyacı vurgular.

Daha fazla bilgi: https://arxiv.org/abs/2410.21012

7. SELA: Otomatik Makine Öğrenimi için Ağaç Araması ile Güçlendirilmiş LLM Agent’ları

Özet

LLM tabanlı AutoML agent’ları genellikle düşük çeşitliliğe sahip ve optimum olmayan pipeline’lar üretir. SELA, agent karar verme süreçlerini ve pipeline keşfini optimize etmek için Monte Carlo Tree Search (MCTS) kullanır.

Temel Katkılar

  • AutoML keşfini iyileştirmek için ağaç arama yöntemlerini uygular.

  • Pipeline’ları deneysel geri bildirimle yinelemeli olarak rafine eder.

  • 20 veri kümesinde geleneksel ve agent tabanlı AutoML temel modellerini geride bırakır.

Daha fazla bilgi: https://arxiv.org/abs/2410.17238

8. AFlow: Agentik İş Akışı Oluşturmayı Otomatikleştirme

Özet

LLM’ler için agentik iş akışları oluşturmak emek yoğundur ve tamamen otomatik değildir. AFlow, iş akışı optimizasyonunu kod grafikleri üzerinde bir arama problemi olarak yeniden çerçevelendirir ve yürütme geri bildirimiyle iş akışlarını yinelemeli olarak rafine etmek için MCTS kullanır.

Temel Katkılar

  • İş akışı optimizasyonunu kod grafiği araması olarak tanımlar.

  • Daha küçük modellerin, maliyetin çok küçük bir kısmıyla GPT-4o’dan daha iyi performans göstermesini sağlar.

  • En ileri düzey temel modellere kıyasla %5.7 iyileşme elde eder.

Daha fazla bilgi: https://arxiv.org/abs/2410.10762

9. Data Interpreter: Veri Bilimi için bir LLM Agent

Özet

Mevcut yaklaşımlar, uçtan uca veri bilimi iş akışları, dinamik görev bağımlılıkları ve alan uzmanlığı gereksinimleri konusunda zorlanmaktadır.

Data Interpreter şunları sunar:

  • Hiyerarşik Grafik Modelleme: problemleri dinamik düğümlerle alt problemlere ayırır.

  • Programlanabilir Düğüm Oluşturma: sağlamlık için kodu yinelemeli olarak rafine eder ve doğrular.

Temel Katkılar

  • Uçtan uca veri bilimi iş akışları için özel olarak tasarlanmış ilk LLM agent’ı.

  • InfiAgent-DABench üzerinde %25 doğruluk artışı sağlar.

  • Makine öğrenimi, açık uçlu görevler ve MATH veri kümesi performansını önemli ölçüde artırır.

Daha fazla bilgi: https://arxiv.org/abs/2402.18679

10. MetaGPT: Çoklu Agent İş Birliğine Yönelik Meta Programming

Özet

LLM tabanlı çoklu agent sistemleri, art arda gelen halüsinasyonlar nedeniyle karmaşık görevlerde sık sık başarısız olur. MetaGPT, Standard Operating Procedures (SOPs) öğelerini istem dizilerine kodlayarak iş akışlarını sadeleştirir ve hataları azaltır.

Temel Katkılar

  • Çoklu agent iş birliği için meta-programming yaklaşımını sunar.

  • SOP tabanlı insan iş akışlarını agent istemlerine dahil eder.

  • Verimli rol ataması ve görev ayrıştırmasını mümkün kılar.

  • İş birlikçi yazılım mühendisliği görevlerinde üstün kararlılık ve doğruluk gösterir.

Daha fazla bilgi: https://arxiv.org/abs/2308.00352

Bu sayfa faydalı oldu mu?

İlgili Makaleler