Ne oldu?

Anthropic'in Frontier Red Team ekibi, modellerin siber saldırı yeteneklerini ölçmek için kullandığı iç "Binary Exploitation" testinden sonuçları paylaştı. Değerlendirme, 100 görevden rastgele seçilen görevler üzerinde birkaç model üzerinde yapıldı.

Sonuçlar

  • GLM-5.3, denemelerin %4'ünde tam kontrol akışı ele geçirmesi (control flow hijack) geliştirdi.
  • Claude Mythos Preview bu orana %6 ile ulaştı.
  • Daha eski modeller olan Claude Opus 4.6 ve GLM-5.2 ise hiçbir denemede başarılı olamadı.

Neden önemli?

Kontrol akışı ele geçirmesi, bir programın çalışma akışının saldırganın istediği yöne çevrilmesi anlamına geliyor; yani modelin yalnızca kod yazması değil, çalışan bir sistemde sömürü üretmesi söz konusu. Anthropic ekibi, GLM-5.3'ün Claude Mythos Preview'ın altında kalsa da önceki modellere kıyasla belirgin bir eşiğin aşıldığını vurguluyor.

Bu tür değerlendirmeler, yapay zekâ modellerinin siber güvenlik açısından ne kadar ilerlediğini ve açık ağırlıklı modellerin de bu alanda ciddi yeteneklere ulaştığını göstermesi bakımından dikkat çekiyor.