İçeriğe geç
Sıfırıncı Dakika
Son haberler

AWS, SageMaker AI'da çok turlu pekiştirmeli öğrenmeyle arama ajanı ince ayarını tanıttı

Yapay ZekâGüncellendi: 2 dk okuma
AWS, SageMaker AI'da çok turlu pekiştirmeli öğrenmeyle arama ajanı ince ayarını tanıttı
AWS Machine Learning Blog

Kısaca

AWS, Amazon SageMaker AI üzerinde çok turlu pekiştirmeli öğrenme (MTRL) ile arama ajanlarının ince ayarını duyurdu. Yöntem, ajanı tek tek yanıtlar yerine tüm çok turlu etkileşim dizisi boyunca optimize ederek küçük modellerin hız ve maliyetini, önceden sınır modeli gerektiren güvenilirlikle birleştirmeyi hedefliyor. AWS, yaklaşımın erişim kalitesi ve güvenilirlikte gözlemlediği sonuçları paylaştı.

  • Modüler ajan-ortam arayüzü ile özel ödül ve araç döngüleri
  • GPU kümesi yönetimi gerektirmeyen sunucusuz, token başına fiyatlandırma
  • Asenkron rollout ve yörünge toplama
  • PPO, CISPO ve önem örnekleme kayıpları ile GRPO, RLOO gibi avantaj tahmincileri
  • Birden fazla işe bölünebilen devam ettirilebilir eğitim
  • MLflow ile yörünge ve ödül gözlemlenebilirliği

Arama ajanları neden zor?

Büyük dil modelleriyle çalışan arama ajanları, kullanıcının mükemmel sorguyu yazmasını beklemek yerine neyi arayacağına, hangi erişim stratejisini kullanacağına ve ne zaman duracağına kendi karar veriyor. Bu kararları birkaç tur boyunca, o ana kadar bulduklarına göre yeniden şekillendiriyor.

Sorun şu: hiçbir temel model sizin araçlarınızı ve ortamınızı bilerek gelmiyor. Küçük bir modeli yönlendirdiğinizde güvenilir çok turlu davranış almak zor; sınır (frontier) bir modelde ise bu yetenek çalışıyor ama gecikme ve maliyet olarak ödüyorsunuz.

İnce ayar ve MTRL

AWS'ye göre ince ayar üçüncü bir yol sunuyor: küçük bir modele kendi araçlarınızı ve ortamınızı doğrudan öğretmek. Böylece küçük modelin hızı ve maliyeti, aksi halde sınır modeli gerektiren güvenilirlikle birleşiyor.

Ancak geleneksel yaklaşımlar yetersiz kalıyor. Denetimli ince ayar (SFT), ideal çok turlu yörüngelerin uzman gösterimlerine dayanıyor; bunları toplamak pahalı ve çoğu kurulum için mevcut değil. Tek turlu pekiştirmeli öğrenme ise her seferinde tek bir yanıtı puanlıyor ve birbirine bağlı çok turlu kararların bağımlılıklarını kaçırıyor.

Çok turlu pekiştirmeli öğrenme (MTRL), ajanı tüm çok turlu yörünge boyunca optimize ediyor. Ödül sinyalinin yalnızca nihai sonucun iyi olup olmadığını yansıtması yeterli.

SageMaker AI MTRL neler sunuyor?

  • Modüler ajan-ortam arayüzü: özel ödüller, özel araç döngüleri ve çok turlu konuşma biçimleri tanımlanabiliyor.
  • Sunucusuz çalıştırma: GPU kümesi kurmadan, token başına fiyatlandırmayla üretim ölçeğinde ajan RL'i.
  • Asenkron rollout ve yörünge toplama: üretim ve gradyan güncellemeleri paralel yürüyor.
  • Yerleşik algoritma kütüphanesi: PPO, CISPO ve önem örnekleme kayıpları; GRPO, GRPO pass@k, RLOO gibi grup tabanlı avantaj tahmincileriyle.
  • Devam ettirilebilir eğitim: uzun eğitimler birden fazla işe bölünebiliyor.
  • Yörünge ve ödül gözlemlenebilirliği: ajanın tur tur ne yaptığı MLflow üzerinden incelenebiliyor.
  • Değerlendirme işleri: dağıtımdan önce ödül, pass@k ve yörünge metrikleri raporlanabiliyor.

AWS, MTRL'yi arama ajanları için doğal bir uyum olarak görüyor: net bir ödül sinyali (erişim kalitesi), çok turlu bir etkileşim döngüsü ve iyi tanımlanmış bir ortam (arama araçları) var.

Neden önemli?

Kurumsal arama ajanlarında güvenilir sonuç almak için ekipler çoğu zaman pahalı sınır modellerine mahkûm kalıyordu. AWS'in yöntemi, küçük bir modeli tüm konuşma boyunca eğiterek benzer güvenilirliği çok daha düşük maliyetle hedefliyor; SageMaker kullanan ekipler için doğrudan uygulanabilir bir seçenek.

Kaynaklar

  1. AWS Machine Learning Blogİlk duyuranBirincil kaynak
    Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI

İlgili haberler