Anthropic: GLM-5.3, siber saldırı testlerinde kritik eşiği aştı
Anthropic Frontier Red Team, 100 görevlik iç Binary Exploitation testinde GLM-5.3'ün denemelerin %4'ünde tam kontrol akışı ele geçirmesi geliştirdiğini, Claude Mythos Preview'ın ise %6'ya ulaştığını bildirdi. Ekip, Claude Opus 4.6 ve GLM-5.2 gibi önceki modellerin hiçbir görevde başarılı olamadığını, dolayısıyla anlamlı bir eşiğin aşıldığını belirtiyor.