Yapay Zeka Modelleri Toyota Corolla'yı Kullandı: 11 Denemenin 8'i Kaza ile Bitti

Bir grup araştırmacı, gündelik sohbet botlarının direksiyona geçmesi halinde ne olacağını test etmeye karar verdi. Yeni yayımlanan kıyaslama çalışmasının sonucu pek iç açıcı değil: Önde gelen yapay zeka ajanlarının çoğu, bir otoparkta konilerle belirlenmiş basit bir parkuru bile tamamlayamadan konilere çarptı.
DrivingBench adı verilen test, Aditya Ramabadran, Simon Mahns ve Tobias Gessler tarafından hazırlandı. Yaklaşım bilinçli olarak sadeleştirilmişti. Özel bir sürüş yazılımı geliştirmek yerine, otonom sürüş dünyasından ödünç alınan Comma görüntü donanımı ve OpenPilot yazılımı bir Toyota Corolla’ya monte edildi. Güzergah, küçük konilerle çevrili, birkaç yumuşak virajdan oluşan kısa bir otopark parkuruydu. Parkurun zorlayıcı olması hedeflenmemişti.
Claude, GPT ve Grok dahil her ajan aynı talimatları aldı ve gaz, fren ile direksiyon üzerinde tam yetkiye sahip oldu. Komutlar kablosuz olarak uzaktaki veri merkezlerine iletildi ve geri döndü; bu yüzden araç zaman zaman yeni talimat beklerken durdu. Her ajana üçer deneme hakkı tanındı.
Sonuçlar düşündürücüydü. Dört ajanla yapılan 11 denemenin sekizinde araçlar parkurun yüzde 11’inden bile ilerleyemedi ve ilk virajda başarısız oldu. Grok, sınır konilerindeki bir boşluğu geçilecek kapı olarak yorumladı ve parkurdan neredeyse anında çıktı. Bir GPT örneği ise talimatta açıkça yasaklanmasına rağmen konilerin rengine dair kendi kendine bir kural uydurdu. Pek çok ajan bir virajın ne kadar direksiyon açısı gerektirdiğini hesaplayamadı ve yeterince dönemedi.
Parkurun tamamını yalnızca GPT-6 Astra bitirebildi; o da ikinci denemesinde başardı. Çizgi son derece dağınıktı: Uzun sağ virajda dışa taştı, bitiş alanına yaklaşırken neredeyse parkurdan çıkıyordu, ama sonucu gördü. Bu başarının maliyeti ise yaklaşık 7,74 dolardı; yani parkurun yarısını ancak geçebilen önceki bir denemenin yaklaşık dört katı. Daha fazla para, daha fazla token, Corolla’yı konilere göndermek için daha fazla fırsat.
Çalışma, otonomi dünyasının yıllardır dile getirdiği bir ayrımı bir kez daha ortaya koyuyor: Araç kullanmak, ikna edici metin üretmekle aynı türden bir problem değil. Sürüş; sürekli uzamsal muhakeme, kalibrasyon ve gerçek zamanlı düzeltme gerektiriyor — yani kalıp eşleştirmeye dayalı dil modellerinin en zayıf olduğu alanlar. Token başına ücretlendirilen yapay zeka ajanlarının sürücüsüz araçlara giden pratik bir yol olup olmadığı belirsizliğini korurken, bu deney mesafenin hâlâ geniş olduğunu gösteriyor.
Şimdilik Corolla sağlam kaldı ve araştırmacıların başkalarının da geliştirebileceği bir kıyaslaması var. Çıta ise oldukça mütevazı: Konilere çarpmadan bir otoparkı geçebilmek.
Ne düşünüyorsunuz?