Saflık sayısı yerine sadakat ölçeği, ajanların gerçekten eksik olduğu yeteneklere odaklanmak ve eğittikleri modellerle evrimleşmek.

Bir bakışta
Bilgisayar kullanım ajanları için on iki eğitim dünyası oluşturduk: on derin alan dünyası ve iki yetenek dünyası, her biri birçok biçimde sunulan tek bir kontrolü işleyerek (tarih seçiciler ve iç içe filtreler). Derinlik, bunların üzerinde eğitim yapmayı değerli kılan şeydir: bu dünyalar bir uygulamanın gerçek davranışını yeniden üretir, gerçekçi verilerle tohumlanır ve ekranlar ve kullanıcılar arasında durumu tutarlı tutar. On iki dünyada eğitim alan 9B modeli, temel puanını neredeyse iki katına çıkarır (36.5%’ten 67.1%’e), GPT-5.4’e on dört puan yaklaşır. Deney bize birkaç ders öğretti:
- Yüksek simülasyon sadakati bir zorunluluktur; yüzeysel dünyalar ajana zarar verir. Aynı sitelerin yüzeysel ve derin yapıları üzerinde eğitim alan model, yüzeysel olanlarda geriledi ancak derin olanlarda gelişti.
- Ajanlar genellikle tarih seçiciler ve iç içe filtreler gibi zorlu UI öğeleriyle mücadele eder. Bu kontrolleri çeşitli biçimlerde işlemek, modele eğitimde hiç görmediği alanlarda bunları kullanmayı öğretti.
- Modeli, dünyayı ve doğrulayıcıyı birlikte evrimleştirmek hepsini geliştirir. Dünya daha doğru hale geldikçe ve görevleri daha zorlaştıkça, model de onunla birlikte yükselir.
- Dünyalara karşı pekiştirme öğrenimi ajanın taklitten öteye geçmesini sağlar. Temellendirilmiş doğrulayıcıyı ödül olarak kullanarak, RL, tutulan performansı artırır ve ajanın hedefe daha az adımda ulaşmayı öğrenmesini sağlar.
- Dört dünyayı kodları, verileri ve temellendirilmiş derecelendiricileri ile birlikte yayınlıyoruz, yüksek sadakatli bilgisayar kullanım dünyaları üzerine araştırmaları desteklemek için.
Github: microsoft/Echoverse: Derin, Evrimsel Ortamlar Bilgisayar Kullanım Ajanları için (yeni sekmede açılır)
Hugging Face:







