Ölçüm bilimi7 dk okuma

Tek ölçüm yanıltır: AI görünürlüğü sabit bir sayı değil

10 marka, 20 soru, üç motor, 10 tekrar — 6.000 çağrılık kendi ölçümümüz, sektörün en yaygın alışkanlığının neden savunulamaz olduğunu gösterdi.

“ChatGPT’de görünürlüğünüz %38” cümlesi, tek bir taramadan üretildiğinde bilgi taşımıyor. Aynı soruyu aynı gün tekrar sorduğunuzda cevabın değişme ihtimali beşte bir. Bunu tahmin etmiyoruz — ölçtük.

Neden ölçtük

Literatür bir süredir üretken motorlarda görünürlüğün sabit bir büyüklük değil rastgele bir değişken olduğunu söylüyor. Schulte ve arkadaşları prompt başına en az yedi-sekiz tekrar öneriyor[1]; kapsamlı bir derleme, alandaki ticari denetimlerde “koşumdan koşuma yüksek değişkenlik” bulunduğunu kaydediyor[3].

Bu sayıları ithal etmek yerine kendi hattımızda ölçmeye karar verdik. 22-23 Ağustos 2026’da 10 marka × 20 soru × 10 tekrar tasarımını üç motorda ayrı ayrı koştuk: ChatGPT, Gemini ve yerel Qwen. Toplamda 6.000 motor çağrısı. Üretim veritabanına hiçbir yazma yapılmadı.

Bulgu 1 — Kararsızlık gerçek ve üç motorda da var

“Kararsız hücre” dediğimiz şey şu: aynı marka, aynı soru, aynı gün, aynı motor — ve on koşumun bir kısmında marka görünüyor, bir kısmında görünmüyor.

MotorKararsız hücreTek koşum yayılımı
ChatGPT%20,54,7 puan
Gemini%18,55,0 puan
Qwen%12,52,9 puan
200 hücrelik portföy toplamında bile tek bir tarama, görünürlük oranını birkaç puan oynatıyor.

Yani her beş sorudan birinde “görünüyor muyuz?” sorusunun cevabı deterministik değil. Bir markanın panelinde gördüğü sayının bir bölümü, o gün zarın nasıl döndüğü.

Bulgu 2 — Beklemediğimiz sonuç: tekrar, marka skorunu düzeltmiyor

Tasarımın amacı “kaç tekrar yeterli?” sorusuna kendi cevabımızı bulmaktı. Tekrar sayısını 1’den 10’a çıkardıkça marka düzeyindeki %95 güven aralığının daralmasını bekliyorduk. Daralmadı.

MotorMarka CI · 1 tekrarMarka CI · 10 tekrar
ChatGPT28,7 puan23,1 puan
Gemini23,0 puan20,9 puan
Qwen21,4 puan21,6 puan
Üç bağımsız motor, aynı sonuç. Qwen’de tekrar sayısı aralığı hiç daraltmadı.
Belirsizliğin baskın kaynağı koşum gürültüsü değil, soru örneklemesi. Tekrar, bir sorunun içindeki gürültüyü azaltır; soru evreninden gelen belirsizliğe dokunmaz.

Bu, literatürdeki “prompt başına 7-8 tekrar” kuralını olduğu gibi almanın neden yanlış olacağını gösteriyor. O kural soru düzeyi kesinlik için doğru — “bu soruda görünüyor muyuz” sorusunu cevaplar. Ama bir markanın genel görünürlük skoru için yanlış kaldıraç. Bağımsız bir varyans ayrıştırması da aynı yöne işaret ediyor: tekrar, ölçüm bütçesinin en verimsiz harcandığı yer[2].

Bulgu 3 — Asıl darboğaz soru sayısı

Ölçtüğümüz standart sapmayla, marka görünürlüğünü belirli bir kesinlikte bilmek için gereken soru sayısını hesapladık:

Aynı bütçenin iki farklı dağıtımı, aynı motor, yaklaşık 200 çağrı:

Bütçe dağılımıMarka güven aralığı
20 soru × 10 tekrar±17 puan
174 soru × 1 tekrar±5 puan
Bütçeyi tekrara değil soruya harcamak, daha ucuza yaklaşık üç kat daha kesin sonuç veriyor.

Bunun sektör için anlamı

Bugün AI görünürlük araçlarının çoğu tek koşumluk bir tarama yapıp tek bir sayı gösteriyor, ertesi gün aynı ölçümü tekrarlayıp aradaki farkı “artış” veya “düşüş” diye raporluyor. Ölçtüğümüz belirsizlik bandı ±17-19 puanken, birkaç puanlık günlük oynamaları trend olarak sunmak savunulamaz.

Bir AI görünürlük raporuna bakarken sorulacak üç soru:

Kapsam uyarısı. Bunlar bizim ölçüm hattımızın sayıları; evrensel sabitler değil. Tek gün, tek soru evreni, üç motor. Qwen kolunda gece taramasıyla yan yana koşarken başarı oranı düştü ve bu koşullu bir sonuç. Kendi hattınızda ölçmeden bu sayıları kullanmayın — bizim çıkardığımız asıl ders zaten bu: ithal edilen kural kendi hattınızda yanlış çıkabilir.

Biz ne yapıyoruz

Bu ölçümün sonucu doğrudan ürüne giriyor. Marka görünürlüğü kartına ölçüm hassasiyeti bandı ekleniyor; bant içinde kalan değişimler “değişim yok (ölçüm gürültüsü içinde)” olarak etiketleniyor ve ok ya da yüzde gösterilmiyor. Soru evrenini büyütmek, tekrar sayısını artırmaktan önce geliyor.

Bir AI görünürlük platformunun satması gereken şey sonuç garantisi değil, ölçüm garantisi: nerede olduğunuzu güven aralığıyla bilmek ve neyin gürültü olduğunu ayırt edebilmek.

Kaynaklar

  1. [1]Schulte et al. — Don’t Measure Once: Measuring Visibility in AI Search (GEO), arXiv:2604.07585
  2. [2]Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers, arXiv:2607.13304
  3. [3]Optimizing Visibility in Generative Engines: A Critical Survey of GEO (2023–2026), arXiv:2607.14035

Etki büyüklükleri, kaynak çalışmaların kendi deney ortamlarına aittir ve doğrudan bir sonuç vaadi değildir. Kendi ölçümlerimize ait sayılar, ilgili yazıda tasarım ve kapsam sınırlarıyla birlikte belirtilmiştir.

Diğer yazılar