EN ▸ Qwen 3.8-Max and Claude Opus 5 show why raw benchmark scores don't predict the bill
Qwen 3.8-Max ve Claude Opus 5: Benchmark Skorları Yanıltıcı Olabilir
VentureBeat ·

Alibaba, bu hafta Qwen 3.8-Max modelini tanıttı ve bu modelin Claude Fable 5'ten sonra en iyi performansı gösterdiğini iddia etti. Ancak bağımsız bir test, Qwen 3.8-Max'ın en iyi ayarının ortalama bir performans sergilediğini ortaya koydu. Bu durum, zaman ve token bütçelerinin sonuçlar üzerindeki etkisini gösteriyor.
Testlerde kullanılan zaman bütçeleri, Alibaba'nın modelinin sonuçlarını önemli ölçüde etkiledi. Bağımsız testlerde daha kısa zaman dilimleri kullanıldığında, Qwen 3.8-Max'ın başarısı düştü. Ayrıca, fiyat-per-token oranlarının artık sonuçları tahmin etmede etkili olmadığı, çünkü düşünme sürecinin de maliyetleri artırdığı vurgulandı.
Sonuç olarak, modellerin seçiminde maliyet ve zaman bütçelerinin dikkate alınması gerektiği belirtiliyor. Ayrıca, her bir çalışmanın başarısızlık nedenlerinin ayrıştırılması gerektiği ifade ediliyor.
