socbench· LLM triyaj ölçümü
Ölçüm raporu · v1.0 · Mayıs 2026
socbench

Bir LLM, L1 analistin işiniyapabilir mi?

Sekiz büyük dil modelini, yirmi kategoriye dağılmış 600 gerçekçi SIEM alarm senaryosunda ölçtük. Her model her senaryoya bir karar verdi; kararlar insan analistlerin etiketlediği ground truth ile karşılaştırıldı. Doğruluk, gecikme ve maliyet birlikte okunmalı — üçü ayrı ayrı yanıltıcı.

Çoğu kıyaslama tek bir doğruluk sayısı verir. socbench o doğruluğun bedelini de ölçer: parayla, saniyeyle ve modelin geçirdiği alarmlarla.

Her model, yirmi kategoriye yayılmış canlı SIEM verisinden alınan aynı 600 alarmı gördü ve her biri için hüküm verdi: gerçek pozitif, yanlış pozitif ya da doğrulama gerekir. Referans etiketler sahada çalışan analistler tarafından konuldu, başka bir model tarafından değil.

600 senaryo · 20 kategori · 8 model · ~20.000 değerlendirme

sıralama

8 modelin tamamı · katı doğruluğa göre sıralı
  1. 01
    Gemini 3.1 Pro
    Google
    92%katı
    92%
  2. 02
    Grok 4.3
    xAI
    89%katı
    89%
  3. 03
    GLM 5.1
    Zhipu AI
    86%katı
    86%
  4. 04
    Kimi K2.6
    Moonshot AI
    83%katı
    83%
  5. 05
    GPT 5.5
    OpenAI
    79%katı
    79%
  6. 06
    Qwen 3.6 35B A3BMoEself-host
    Alibaba
    79%katı
    79%
  7. 07
    Claude Opus 4.7thinking max
    Anthropic
    78%katı
    78%
  8. 08
    DeepSeek V4 Pro
    DeepSeek
    69%katı
    69%
çubuk = katı doğruluk, birebir eşleşme puanlamasıtamamı ↓

Katı puanlama birebir eşleşme ister. Operasyonel olarak aynı kapıya çıkan “gerçek pozitif” ile “doğrulama gerekir” birleştirildiğinde her model yükselir; bazıları diğerlerinden çok daha fazla.

Buradaki sıralama yalnızca doğruluk. Bu sekizin beşi, hem daha ucuz hem daha doğru bir model tarafından maliyette geçiliyor; altısı aynı şekilde gecikmede geçiliyor.

01 / Sıralama

Aynı sınav, iki farklı okuma

Katı puanlama tam eşleşme arar: TP=TP, FP=FP, CCN=CCN. Esnek puanlamada TP ve CCN birleşir — operasyonel olarak ikisi de “kapatma, aksiyon al” yönündedir. Aradaki mesafe, modelin gerçek tehdit ile teyit gerektiren durum arasındaki tereddüdünü ölçer; uzun çizgi, kararsız model demektir.

Katı doğruluk · sekiz modelin dağılımı600 senaryo · ~20.000 değerlendirme
KatıEsnek (TP↔CCN birleşik)

Nasıl okunur.Bu skorlar bu senaryo setine özgüdür; genel model yeteneğinin ölçüsü değildir. Ölçtükleri tek şey şu: bir L1 analistin vereceği kararı, insan etiketiyle aynı şekilde verebiliyor mu. Sütun başlıklarına tıklayarak sıralayabilirsin.

ModelSağlayıcıKatıEsnekD / K / YGecikmeToplam$ / doğru

Yavaş düşünmek ödül vermiyor. Tam tersini yapıyor.

En uzun süre muhakeme eden iki yapılandırma — Claude Opus 4.7 (thinking · max) ve Kimi K2.6, alarm başına 104 saniye — sıralamanın alt yarısında. En hızlı model Grok 4.3 aynı zamanda ikinci en doğrusu. Bu görevde ek düşünme süresi doğruluğa dönüşmüyor.
02 / Maliyet

Doğruluğun fiyatı 32 kat değişiyor

Sol üst köşe aradığın yer: ucuz ve doğru. Sağ alt: pahalı ve zayıf. En pahalı model en ucuzun 32 katına mal oluyor ve ondan yalnızca 8 puan daha doğru — yatay eksen bu yüzden logaritmik.

03 / Gecikme

Kuyruk beklemez

Bir SOC kuyruğunda alarm başına 100 saniye, gerçek zamanlı triyajı imkânsız kılar. Bu grafik hız ile doğruluk arasında bir takas olup olmadığını soruyor. Bulut dağınık: takas yok.

04 / Veri seti

Kolay kazanılamayan bir dağılım

Senaryolar gerçek SOC kuyruklarının bileşimini yansıtacak şekilde dağıtıldı. Beşte biri müşteri teyidi gerektiren belirsiz durumlar, sekizde biri temiz yanlış alarm — yani her şeye “kötü niyetli” diyen bir model yüksek puan alamaz.

KararAnlamıAdetPay
TPGerçek kötü niyetli aktivite; kritik olanlar otomatik L2 eskalasyonu tetikler383
CCNYetki veya kapsam teyidi gerekiyor — müşteriye sorulmalı122
FPYanlış alarm, kapatılabilir68
IDKarar için yeterli bilgi yok27
Yirmi kategori
05 / Yöntem

Ölçüm nasıl yapıldı

Zarf

Her senaryo, bir analistin ekranında göreceğine yakın bir zarf olarak hazırlandı: ham log alanları, varlık bağlamı ve tetikleyen kural başlığı. Modelden serbest metin değil, dört seçenekten biri istendi.

Ground truth

Etiketler insan analistler tarafından verildi ve modellere hiçbir aşamada gösterilmedi. Kritik TP’ler otomatik L2 eskalasyonu tetikleyecek şekilde işaretlendi.

Tekrar

Her senaryo yaklaşık 30 varyantla çalıştırıldı; raporlanan skorlar bu koşumların birleşimidir. Tek koşum kanıt sayılmaz — modeller arası fark gürültüden ancak tekrarla ayrılır.

Maliyet

Sağlayıcıların ölçüm tarihindeki liste fiyatlarından hesaplandı. Qwen 3.6 kendi donanımımızda çalıştı; gösterilen tutar eşdeğer API fiyatlandırmasıdır, elektrik maliyeti değil.

SOC Benchmark v1.0 — 10 Mayıs 2026

600 senaryo · 8 model · 20 kategori · yaklaşık 20.000 değerlendirme.

Bağımsız bir ölçüm çalışmasıdır; hiçbir model sağlayıcısı tarafından desteklenmemiştir. Skorlar bu senaryo setine özgüdür ve genel model yeteneğinin ölçüsü olarak okunmamalıdır.