Ana içeriğe geç
Yapay Zeka · Business & Lab

Yapay Zeka Görünürlük Araçları ve Danışmanlığı Nasıl Değerlendirilmeli?

← Yapay Zeka

Yazan Evren BalYayın tarihi  · 9 dk okuma

Bir yazılım paneliyle danışmanlık teklifi arasındaki yanıt kartı büyüteçle inceleniyor.
Bu yazıyı yapay zekâ ile tartış
Sayfayı kopyala

💡 Özet (TL;DR)

  • Tedarikçiden skorun ne anlama geldiğini, hangi yanıtlara dayandığını, promptların nasıl seçilip ağırlıklandırıldığını açıklaması istenmelidir.
  • Testin müşterilerinizle ilgili olduğunu gösteren kanıtlar istenmelidir. Test koşulları, yapılan değişiklikler ve yöntemin sınırları da öğrenilmelidir.
  • Ürün satın alınacaksa, hangi amaçla kullanılacağı eldeki kanıta göre belirlenmelidir. Ek doğrulama olmadan test skoru müşteri erişimi veya ticari etki olarak yorumlanmamalıdır.

Örneğimizde bir ajans, Yapay Zeka Görünürlük Skorunuzu 63'ten 80'e çıkarmayı teklif ediyor. Kolay ve rahat okunabilir bir kullanıcı paneli, tanıdık rakipler bu iyileşmeyi potansiyel müşterilere daha fazla ulaşma ile ilişkilendiren bir teklif.

Hedefi konuşmadan önce, 63'ün 80 olmasıyla neyin değiştiğini öğrenmek gerekir. Seçilmiş yanıtlarda daha fazla anılma mı? Satın alma konuşmalarında daha fazla öneri mi? Markanın daha büyük oranda potansiyel müşteriye gösterilmesi mi? Bu iddiaların her biri farklı kanıt ister.

Bir yapay zeka görünürlük aracı, bunların hepsini ölçmeden de satın almaya değer olabilir. Satın alma kararı, aracın sunduğu kanıtın ihtiyacınız olan kararı destekleyip desteklemediğine bağlıdır.

Bir testi tekrar etmek sonucu daha istikrarlı kılabilir, fakat o testin müşterilerinizi temsil ettiğini kanıtlamaz. Burada asıl mesele, tedarikçinin gösterebildiği şeyin ne olduğunu ve hangi varsayımı yapmanız gerektiğini anlamaktır.

Görünürlük neyi vadediyor ve bu nasıl ölçülecek?

Daha iyi bir değerlendirme için hizmet sağlayıcıdan skorun neyi ölçtüğünü tek cümlede açıklaması istenmelidir.

Tedarikçi bu skoru, izlenen bir prompt setinde, yapay zekanın verdiği yanıtlarda markanızdan söz edilme oranı olarak tanımlayabilir. Bu anlaşılır bir kıyaslama iddiasıdır. Vadedilen sonuç müşteri dikkatinden aldığınız payın artmasıysa, tanım ve vaat arasındaki bağ net değil ve açıklanması gerekir.

“Yön gösterici” demek de tek başına yeterli değildir. Neye doğru yön gösteriyor? Hangi kitle için yön gösteriyor? Skor ve kitlenin markayla karşılaşmasındaki hareketleri arasındaki bağı nasıl kanıtlandırıyor?

Metriği değerlendirmeden önce, hangi amaçla kullanılacağı netleştirilmelidir. Seçilmiş promptlardaki yanıtları izlemeyi sağlayan bir metrik yararlı araştırma sinyalleri sağlayabilir.

Bir ajansı değerlendirmek, büyük bir bütçeyi gerekçelendirmek veya müşteri erişiminin arttığını iddia etmek için kullanılan bir skor ise bu yorumları destekleyen daha güçlü kanıt ister.

Skorun hesabı, dayandığı yanıtlarla birlikte incelenmelidir

Anılma, öneri ve farklı soruların ağırlığı arasındaki ayrım, AI Görünürlük Skoru Neyi Ölçüyor? yazısında ele alınıyor. Tedarikçi görüşmesinde ise bu ayrımların sunulan raporda nasıl uygulandığı açıklanmalıdır.

Örneğimizdeki 63 puanın nasıl hesaplandığını görmek için tedarikçiden rapordaki birkaç yanıtı açması istenmelidir. Hangi yanıtın skoru nasıl etkilediği tedarikçiyle birlikte incelenmelidir.

Markanın hangi durumda görünür sayıldığı öğrenilmelidir. Skor bir oransa, neyin neye bölündüğü açık olmalı. Her yanıt hesaplamayı aynı ölçüde mi etkiliyor, yoksa bazılarına daha fazla ağırlık mı veriliyor? Sonuç rakiplerle karşılaştırılarak hesaplanıyorsa, karşılaştırmaya alınan markaları değiştirmenin skoru nasıl etkilediği de sorulmalıdır.

Böylece “görünürlük” denildiğinde neyin sayıldığı ve bu sayımdan nasıl bir puan çıkarıldığı anlaşılabilir. “Bize özel yapay zekamız markanızın otoritesini analiz ediyor” açıklaması, hesaplamanın nasıl yapıldığını söylemez.

İnceleme için birkaç farklı yanıt seçilmelidir: Markanız hakkında olumlu bir yanıt, olumsuz bir yanıt ve nasıl yorumlanacağı açık olmayan bir yanıt. Aracın bunları nasıl sınıflandırdığına bakılmalıdır. Markanızın adı bir uyarıda geçtiğinde de görünürlük puanı artıyor mu? Ürününüzün kullanım kılavuzunun kaynak gösterilmesi, ürünün tavsiye edilmesi olarak mı sayılıyor? Aynı yanıtta adı geçen birden fazla marka puan alabiliyor mu? Satın alınabilecek seçenekler arasında yer almakla, konuşmanın sonunda önerilen marka olmak ayrı ayrı ölçülüyor mu?

Bunları açıklamak için tedarikçinin kaynak kodunu paylaşması gerekmez. Hangi durumların skoru artırdığını ve puanın nasıl hesaplandığını anlayabileceğiniz kadar bilgi vermesi yeterlidir. Ticari nedenlerle bazı ayrıntıları açıklamıyorsa, sonuca neden güvenebileceğinizi başka kanıtlarla göstermelidir.

Testteki sorular gerçekten müşterilerinizin soruları mı?

Ölçümün temel sorununu AI Görünürlük Testleri Gerçek Müşterileri Ne Kadar Temsil Ediyor? yazısında açıklamıştım.

Tedarikçiye testte kullandığı soruları, yani promptları, nereden bulduğu sorulmalıdır. Arama motorlarında yapılan sorgular mı kullanılmış? Kullanıcıların yapay zekaya sorduğu sorular mı gözlenmiş? Sorular doğrudan müşterilerden mi alınmış, danışmanlar tarafından mı seçilmiş, yoksa yapay zekayla mı üretilmiş? Bunlar aynı türde bilgi sağlamaz.

Bir sorunun ürününüzle ilgili olması, müşterilerinizin o soruyu sık sorduğunu göstermez. Aynı şekilde, satın alma kararının hangi aşamasında sorulduğunu veya toplam skoru ne kadar etkilemesi gerektiğini de söylemez.

Bu nedenle her sorunun hesaplamadaki ağırlığı öğrenilmelidir. Tüm sorular eşit mi sayılıyor? Daha sık sorulduğu gözlenen sorulara mı, yoksa işletmenin daha önemli bulduğu konulara mı daha fazla ağırlık veriliyor? Tedarikçi arama hacmini kullanıyorsa, bunun arama motorlarındaki talebi gösterdiğini mi söylüyor? Yoksa aynı sorunun yapay zeka sohbetlerinde de o sıklıkta sorulduğunu mu varsayıyor? İkinci yorum için, arama hacmiyle sohbetlerdeki sıklık arasında bağlantı gösteren bir kanıt gerekir.

Testin hangi ülkeleri, dilleri, ürünleri ve müşteri gruplarını kapsadığı da öğrenilmelidir. Satın alma sürecinin hangi aşamalarındaki sorular test ediliyor, hangileri dışarıda kalıyor? Tedarikçinin elinde büyük bir veri tabanı olması, sizin müşterileriniz hakkında yeterli verisi olduğu anlamına gelmez.

Bazı tedarikçiler testlerinde persona adı verilen müşteri profilleri kullanabilir. Böyle bir profil sunuluyorsa, nasıl oluşturulduğu sorulmalıdır. Profilde kişinin yaşı, mesleği ve aile hayatının ayrıntılı anlatılması, gerçek müşterileriniz gibi karar verdiğini göstermez. Tedarikçinin açıklaması gereken, profiller arasında hangi davranış farklarının bulunduğu ve bu farkları hangi müşteri gözlemlerine dayandırdığıdır. Demografik bilgiler veya yapay zekanın yazdığı bir biyografi bunun için yeterli değildir.

Testin birkaç soru ve yanıttan oluşması da tek başına gerçekçiliğini kanıtlamaz. İlk sorudan sonra takip soruları sormak, konuşmayı uzatır. Bu konuşmanın müşterilerin satın alma sürecine benzediğini göstermek için ayrıca kanıt gerekir. Hangi bölümlerin gözlenen davranışlara dayandığı, hangilerinin varsayım olduğu öğrenilmelidir. Alıcının sistemin nasıl geliştirildiğini bilmesi gerekmez. Ancak test edilen konuşmanın müşterileriyle neden ilgili olduğunu anlayabilmesi gerekir.

Testin hangi koşullarda yapıldığı öğrenilmelidir

Raporda yalnızca kullanılan yapay zeka ürününün adının yazması yeterli değildir. Sonucun hangi koşullarda alındığı da belirtilmelidir.

Tedarikçi, müşterilerin kullandığı arayüzdeki yanıtları mı inceliyor, yoksa modele API üzerinden mi bağlanıyor? Hangi model ve ürün modu kullanılıyor? Web araması açık mı? Her soru yeni bir konuşmada mı soruluyor, yoksa model önceki mesajları da görüyor mu? Sorunun ve önceki mesajların dışında, modele başka bilgi veriliyor mu? Bunlar, testin neyi kapsadığını anlamak için sorulabilecek sorulardır.

Dil ve ülke seçiminin testte neyi değiştirdiği de öğrenilmelidir. Bir soruyu Türkçeye çevirmek veya panelden Türkiye'yi seçmek, Türkiye'deki kullanım koşullarından hangilerinin testte dikkate alındığını tek başına açıklamaz.

Tedarikçi kullandığı yapay zeka ürününün bazı ayarlarını göremiyor olabilir. Bu ayarları bilmediğini açıkça söylemesiyle, biliyormuş gibi raporlaması farklı şeylerdir. Raporda hangi koşulların bilindiği, hangilerinin varsayıldığı ve hangilerinin gözlenemediği ayrı ayrı belirtilmelidir.

Geçen ayla bu ayın sonuçları karşılaştırılırken de aynı koşulların geçerli olup olmadığına bakılmalıdır. Model güncellenmiş, sorular değiştirilmiş veya puanlama kuralları yenilenmiş olabilir. Soruların hesaplamadaki ağırlıkları da değişmiş olabilir. Tedarikçiye bu değişiklikleri kaydedip kaydetmediği ve grafiği açıklarken hesaba katıp katmadığı sorulmalıdır.

Bu kayıtlar yoksa, ölçümdeki bir değişiklikten kaynaklanan puan artışını kampanyanızın başarısı sanabilirsiniz. Tedarikçi artışın bütün nedenlerini kesin olarak açıklayamasa da bu belirsizliği raporda belirtmelidir.

Test sonuçları gerçek müşteri davranışıyla karşılaştırılmış mı?

Testte elde edilen skorun, müşterilerin gerçekte ne gördüğünü anlattığı iddia ediliyorsa bunu destekleyen kanıt istenmelidir.

Tedarikçi, skoru gerçek müşterilerin gözlenen davranışlarıyla karşılaştırmış mı? Tam olarak neyi, hangi müşteri grubunda ve hangi dönemde gözlemiş? Skordaki değişimle müşteri davranışındaki değişim ne ölçüde uyuşmuş, nerelerde uyuşmamış? Bu bulgular sizin pazarınızla ilgili mi, yoksa önemli ölçüde farklı bir müşteri grubundan mı geliyor?

Satış artışı gibi bir ticari sonuç vaat ediliyorsa, bu sonuçla görünürlük arasındaki bağlantı ayrıca gösterilmelidir. Bir vaka çalışmasında hem skorun hem satışların artmış olması bilgi verebilir. Fakat satışları skordaki artışın yükselttiğini kanıtlamaz. Aynı dönemde başka değişiklikler de satışları etkilemiş olabilir.

Kanıtın kim tarafından ve nasıl incelendiğine de bakılmalıdır. Tedarikçinin kendi analizi, bağımsız incelemeden geçmiş bir çalışma ve memnun bir müşterinin yorumu aynı ağırlıkta değildir. Yanlarına ayrıntılı bir grafik koymak, bu kanıtları daha güçlü hâle getirmez.

Varsa, birinci taraf sinyalleri de gerçeklik kontrolü olarak değerlendirilmelidir: UTM parametreleriyle işaretlenmiş yönlendirmeler, sunucu kayıtları, CRM kayıtları veya üzerinde anlaşılmış başka bir veri kaynağı. Bu sinyaller yapay zekâ üzerinden gelen ziyaretlerin tamamını göstermeyebilir ve kendilerine özgü ilişkilendirme boşlukları taşıyabilir. Yine de ileri sürülen artışın işletmede gözlenebilen bir karşılığı olup olmadığını anlamaya yardımcı olabilirler. Böyle bir karşılaştırma yapılamıyorsa skor kontrollü bir kıyaslama olarak yine yararlı olabilir; ancak iddia test koşullarıyla sınırlı tutulmalıdır.

Test sonuçları gerçek müşteri davranışıyla karşılaştırılmamış olsa da araç yararlı olabilir. Seçilmiş sorulara verilen yanıtları izlemek, belirli koşullarda alınan sonuçları karşılaştırmak veya daha ayrıntılı araştırılacak konuları bulmak için satın alınabilir. Ancak bu sonuçları, kaç müşteriye ulaştığınızın ölçümü olarak sunmak için yeterli dayanağınız olmayabilir.

Tedarikçiye yöntemin sınırları da sorulmalıdır. Bazı pazarlarda yeterli verisi olmayabilir. Kişiselleştirmenin yanıtlara etkisini gözleyemiyor olabilir. Skoruyla gerçek müşterilerin markayı görme oranı arasında henüz bir ilişki gösterememiş olabilir. Bu sınırların açıkça söylenmesi, aracı nerede kullanabileceğinize karar vermenizi kolaylaştırır.

Ürünün yapay zeka yanıtında görünmesi, seçeneklerin karşılaştırılması ve satın alma ayrı sahnelerde gösteriliyor.

Bir yanıtta görünmek, satın alma seçenekleri arasına girmek ve satın alınmak farklı olaylardır. Birinin kanıtı, sonrakinin de gerçekleştiğini göstermez.

Skor mu iyileşti, hesaplama mı değişti?

Aynı tedarikçi test sorularını seçiyor, görünürlüğü artırmak için hizmet veriyor ve kendi başarısını yine bu skorla raporluyorsa dikkat edilmesi gereken bir durum vardır. Soruları veya hesaplama kurallarını değiştirmek, ilerleme göstermeyi kolaylaştırabilir. Tedarikçi kasıtlı olarak yanıltmaya çalışmasa bile, kendi çalışmasını daha başarılı gösteren seçimlere yönelebilir.

Bu yüzden teste kimin soru ekleyip çıkarabildiği öğrenilmelidir. Soruların ağırlıklarını, karşılaştırılan rakipleri veya puanlama kurallarını kim değiştirebiliyor? Değişikliklerin ne zaman yapıldığı görülebiliyor mu? Skor yükseldiğinde, karşılaştırılan iki dönemde aynı kuralların kullanıldığı kontrol edilebiliyor mu?

Aynı risk kendi ekibiniz için de geçerlidir. Markanızın iyi sonuç aldığı soruları teste sürekli eklerseniz, müşterileriniz hakkında yeni bir şey öğrenmeden rapordaki puanı yükseltebilirsiniz.

Tedarikçiyle bir performans hedefi üzerinde anlaşılmadan önce, yanıtlardaki iyileşmeyle hesaplama değişikliğinden kaynaklanan artışın nasıl ayrılacağı netleştirilmelidir. Ayrıca bir iyileşmeyi danışmanın çalışmasına bağlamak için hangi kanıtın isteneceği belirlenmelidir. Puanın yükseldiğini görmek, neden yükseldiğini açıklamaya yetmez.

Aracın hangi amaçla kullanılacağı belirlenmelidir

Satın alma kararı için bütün belirsizliklerin giderilmesi gerekmez. Ancak verilecek karar açısından hangi eksiklerin önemli olduğu bilinmelidir.

Skorun nasıl hesaplandığı belirsizse, dayandığı yanıtlar incelenemiyorsa veya ölçümdeki değişiklikler açıklanmıyorsa, bu eksikler giderilene kadar ekip ya da tedarikçi performansı bu skorla değerlendirilmemelidir. Müşteri davranışıyla bir ilişki gösterilmiş olsa bile, bulgular yalnızca geçerli oldukları pazar ve müşteri grupları için yorumlanmalıdır.

Araç belirli bir amaç için satın alınabilir, daha geniş kullanım için önce denenebilir, ek kanıt istenebilir veya satın almaktan vazgeçilebilir. Bu kararı tedarikçinin büyüklüğü veya panelin ne kadar gelişmiş göründüğü belirlememeli.

Görüşmede netleşenler kısa bir notta toplanmalıdır: Tedarikçi ne iddia ediyor, bunu hangi kanıtla destekliyor, ölçümün sınırları neler ve bu skor hangi kararlarda kullanılacak? Skor daha sonra yönetim kurulu sunumuna girdiğinde, satış görüşmesinde söylenen sınırlamalar unutulmuş olabilir. Bu not, sayıya ölçmediği bir anlam yüklenmesini önlemeye yardımcı olur.

Seçilmiş sorulara verilen yanıtları düzenli olarak izlemek, tek başına satın almaya değer bir hizmet olabilir. Fakat bu skor, ekibinizin veya danışmanınızın çalışması sayesinde markanızın daha fazla müşteriye gösterildiğinin kanıtı olarak kullanılacaksa daha güçlü bir dayanak gerekir. Tedarikçi skorun neyi gösterip neyi göstermediğini açıklamalı. Sonuç kullanılırken de bu sınır korunmalıdır.

Bu yazıyı faydalı bulduysanız

Web sitenizde ilgili bir içerikten bu yazıya bağlantı vermeniz ya da sosyal medyada paylaşmanız, daha fazla kişiye ulaşmasına gerçekten yardımcı olur. Desteğiniz için teşekkür ederim.

Bağlantı ve marka kullanım rehberi →

Bu yazı hakkında

Yapay zekâ kullanımı
Yapay zekâ desteği kullanıldı — Ölçüm eleştirisini, alıcının soracağı soruları ve yazının kapsamını Evren Bal belirledi. Bu fikirlerin Türkçe rehbere uyarlanmasında, düzenlenmesinde ve dil incelemesinde yapay zekadan yararlanıldı. Kapak ve yazı içi görseller de yapay zekâyla üretildi.