Dondurulmuş 18 skill takımında katı tam rota doğruluğu: 124 pozitif, 43 negatif vaka.
geoai-skills
Sessiz CRS, mekânsal sızıntı, geçerlilik, birim ve belirsizlik hatalarını yayına çıkmadan durdurur.
Mekânsal iş sessizce bozulur
Yanlış bir projeksiyon istisna fırlatmaz. Aynı tarlanın iki tarafta birden yer almasına izin veren bir eğitim/test ayrımı da, derece cinsinden hesaplanmış bir alan da, belirsizliği belirtilmemiş kendinden emin bir sayı da fırlatmaz. Analiz tamamlanır, harita çizilir ve hata yayına çıkar.
Bu on sekiz skill, genel amaçlı bir ajana mekânsal uzmanın reflekslerini kazandırır: bir mesafeye güvenmeden önce CRS'i kontrol et, mekânsal otokorelasyonu varsayılan kabul et ve kanıtın desteklemediği bir sonucu söylemeyi reddet.
Tek bir yaşam döngüsünde on sekiz skill
Orkestratör isteği parçalara ayırır ve beş aşama boyunca yönlendirir. Skill'ler dar tetiklenecek biçimde yazılmıştır: takımdaki negatif ve çakışma vakaları özellikle aşırı tetiklenmeyi sınar.
Ölçülen yönlendirme davranışı
Dondurulmuş bir takıma karşı kaydedilmiş aktivasyonlardan deterministik puanlama ve açık/kapalı kontrol koşulu. Asıl önemli olan kontrol: skill'ler kapalıyken aynı model aynı vakalarda hiçbir şey tetiklemiyor.
Ölçülen yönlendirme davranışı
Claude Code 2.1.214 ve claude-sonnet-5 üzerinde kaydedilmiş aktivasyonlardan deterministik puanlama; açık/kapalı kontrol koşuluyla ve kapsam sınırları açıkça belirtilerek.
0 aktivasyon across all 167 cases. Duyarlılık 0%, route accuracy 0%, overall accuracy 25.75%. The lift is attributable to the skills, not to the base model.
Her skill'in, görevden bağımsız olarak dayattığı kurallar
- Herhangi bir ölçüme güvenilmeden önce CRS ve birimler açıkça belirtilir.
- Mekânsal sızıntı uç durum değil, varsayılan risktir.
- Her aşama bir doğrulama adımıyla biter.
- Belirsizlik ve duyarlılık dipnot değil, çıktıdır.
- Eksik kanıt iddiayı daraltır ya da engeller.
Yayımlanan metrikler yönlendirme davranışını tanımlar: doğru istek için doğru skill'in tetiklenip tetiklenmediğini, Claude Code 2.1.214 ve claude-sonnet-5 üzerinde, 2026-08-05 tarihinde ölçülmüş. Bu skill'lerin ürettiği cevapların kalitesi hakkında hiçbir şey söylemezler. Ayrılmış küme önceki bir koşuda kullanılmıştı; bu da iyileşmeyi doğrulama gücünü sınırlar.