Sekiz büyük dil modelini, yirmi kategoriye dağılmış 600 gerçekçi SIEM alarm senaryosunda ölçtük. Her model her senaryoya bir karar verdi; kararlar insan analistlerin etiketlediği ground truth ile karşılaştırıldı. Doğruluk, gecikme ve maliyet birlikte okunmalı — üçü ayrı ayrı yanıltıcı.
Çoğu kıyaslama tek bir doğruluk sayısı verir. socbench o doğruluğun bedelini de ölçer: parayla, saniyeyle ve modelin geçirdiği alarmlarla.
Her model, yirmi kategoriye yayılmış canlı SIEM verisinden alınan aynı 600 alarmı gördü ve her biri için hüküm verdi: gerçek pozitif, yanlış pozitif ya da doğrulama gerekir. Referans etiketler sahada çalışan analistler tarafından konuldu, başka bir model tarafından değil.
600 senaryo · 20 kategori · 8 model · ~20.000 değerlendirme
sıralama
8 modelin tamamı · katı doğruluğa göre sıralıKatı puanlama birebir eşleşme ister. Operasyonel olarak aynı kapıya çıkan “gerçek pozitif” ile “doğrulama gerekir” birleştirildiğinde her model yükselir; bazıları diğerlerinden çok daha fazla.
Buradaki sıralama yalnızca doğruluk. Bu sekizin beşi, hem daha ucuz hem daha doğru bir model tarafından maliyette geçiliyor; altısı aynı şekilde gecikmede geçiliyor.
Katı puanlama tam eşleşme arar: TP=TP, FP=FP, CCN=CCN. Esnek puanlamada TP ve CCN birleşir — operasyonel olarak ikisi de “kapatma, aksiyon al” yönündedir. Aradaki mesafe, modelin gerçek tehdit ile teyit gerektiren durum arasındaki tereddüdünü ölçer; uzun çizgi, kararsız model demektir.
Nasıl okunur.Bu skorlar bu senaryo setine özgüdür; genel model yeteneğinin ölçüsü değildir. Ölçtükleri tek şey şu: bir L1 analistin vereceği kararı, insan etiketiyle aynı şekilde verebiliyor mu. Sütun başlıklarına tıklayarak sıralayabilirsin.
| Model | Sağlayıcı | Katı | Esnek | D / K / Y | Gecikme | Toplam | $ / doğru |
|---|
Yavaş düşünmek ödül vermiyor. Tam tersini yapıyor.
Sol üst köşe aradığın yer: ucuz ve doğru. Sağ alt: pahalı ve zayıf. En pahalı model en ucuzun 32 katına mal oluyor ve ondan yalnızca 8 puan daha doğru — yatay eksen bu yüzden logaritmik.
Bir SOC kuyruğunda alarm başına 100 saniye, gerçek zamanlı triyajı imkânsız kılar. Bu grafik hız ile doğruluk arasında bir takas olup olmadığını soruyor. Bulut dağınık: takas yok.
Senaryolar gerçek SOC kuyruklarının bileşimini yansıtacak şekilde dağıtıldı. Beşte biri müşteri teyidi gerektiren belirsiz durumlar, sekizde biri temiz yanlış alarm — yani her şeye “kötü niyetli” diyen bir model yüksek puan alamaz.
| Karar | Anlamı | Adet | Pay |
|---|---|---|---|
| TP | Gerçek kötü niyetli aktivite; kritik olanlar otomatik L2 eskalasyonu tetikler | 383 | |
| CCN | Yetki veya kapsam teyidi gerekiyor — müşteriye sorulmalı | 122 | |
| FP | Yanlış alarm, kapatılabilir | 68 | |
| ID | Karar için yeterli bilgi yok | 27 |
Her senaryo, bir analistin ekranında göreceğine yakın bir zarf olarak hazırlandı: ham log alanları, varlık bağlamı ve tetikleyen kural başlığı. Modelden serbest metin değil, dört seçenekten biri istendi.
Etiketler insan analistler tarafından verildi ve modellere hiçbir aşamada gösterilmedi. Kritik TP’ler otomatik L2 eskalasyonu tetikleyecek şekilde işaretlendi.
Her senaryo yaklaşık 30 varyantla çalıştırıldı; raporlanan skorlar bu koşumların birleşimidir. Tek koşum kanıt sayılmaz — modeller arası fark gürültüden ancak tekrarla ayrılır.
Sağlayıcıların ölçüm tarihindeki liste fiyatlarından hesaplandı. Qwen 3.6 kendi donanımımızda çalıştı; gösterilen tutar eşdeğer API fiyatlandırmasıdır, elektrik maliyeti değil.
600 senaryo · 8 model · 20 kategori · yaklaşık 20.000 değerlendirme.
Bağımsız bir ölçüm çalışmasıdır; hiçbir model sağlayıcısı tarafından desteklenmemiştir. Skorlar bu senaryo setine özgüdür ve genel model yeteneğinin ölçüsü olarak okunmamalıdır.