Ekipten
0,78'lik bir faithfulness skorunun bize hiç söylemedikleri
quots'tan önce bir WhatsApp randevu agent'ının değerlendirme altyapısını kurduk. Metrikler yeşildi, müşteriler değildi. quots'un kapatmak için var olduğu boşluk bu.
quots'tan önce bu ürünün öbür tarafındaki ekiptik. Haftada binlerce müşteriyle konuşan bir WhatsApp randevu agent'ının değerlendirme altyapısını kurduk: altı prompt sürümü, elle yazılmış 150'den fazla test senaryosu ve 0,78'de sabitlenen bir faithfulness skoru.
Her ölçüte göre iyi bir sayıydı. Haftalık rapora girdi. Yayın kontrol listesini yeşile çevirdi. Ve agent'ın, kendisiyle konuşan insanlara gerçekte ne yaptığı konusunda bize neredeyse hiçbir şey söylemedi.
Panel "yayınla" diyordu
0,78 içeriden şöyle görünüyordu: Bir müşteri söze, şifresini zaten iki kez sıfırladığını söyleyerek giriyor; agent ona neşeyle üçüncü kez sıfırlama linki gönderiyordu. Bir kuaför salonu sahibi randevusunu taşımak istiyor, randevunun nasıl iptal edileceğine dair bağlama gayet sadık bir cevap alıyordu. Bu konuşmaların her biri, tek bir skoru besleyen kontrollerden geçti; çünkü cevaplar agent'a verilen bağlama sadıktı.
Skor yanlış değildi. Başka bir sorunun cevabıydı. Faithfulness, bir cevabın bağlamına sadık kalıp kalmadığını ölçer. Belirli bir geçmişi olan, sabrı belirli bir noktada tükenen bir müşteri tipinin aradığını bulup bulmadığını ölçmez.
Ortalamanın gizledikleri
Konuşmaları nihayet segment segment okuduğumuzda 0,78 birbirine benzemeyen parçalara ayrıldı. İlk randevusunu alanlar: neredeyse kusursuz. Az ve öz konuşan, araçlara hâkim müdavimler: talep beklenen akıştan çıkmadığı sürece güçlü. Bir sorunla geri dönen, bir şeyi zaten denemiş ve bunu söylemiş müşteriler ise o kadar istikrarlı kaybediyordu ki bu neredeyse bir politikaydı.
Agent yüzde 78 iyi değildi. Bazı insanlarla mükemmeldi, bazılarını sessizce harcıyordu; ve sayının bunu söyleyecek hiçbir yolu yoktu.
Hiçbir panel o insanların adını koymadı. Hiçbir metrik, güvenlerinin neden dördüncü turda çöktüğünü açıklamadı (çoktan eledikleri adımlar kendilerine baştan anlatılıyordu). Hepsini gece yarısı konuşma okuyarak öğrendik; bu yöntem tam olarak bir kez işe yarar, ölçeklenmez.
Asıl iş "hangisi" ve "neden"
Rahatsız edici sonuç şuydu: o gece yarısı okumaları geçici bir çözüm değildi. İşin kendisiydi: konuşmaları gerçekten var olan müşteri tiplerine ayırmak, her tipe karşı test etmek, segment başına notlamak ve her kararın arkasındaki konuşmayı saklamak — ki bulgu denetlenebilsin.
Biz de o zaman istediğimiz aracı yaptık. quots, persona'ları kendi sohbet geçmişinizden türetir; her persona'ya agent'ınızı binlerce tur boyunca sorgulatır ve agent'ınızın hangi segmentleri kazandığını, hangilerini kaybettiğini ve nedenini kanıtlarıyla raporlar.
Gerçek biri görmeden prova edin
Aynı mekanizma, her yayın öncesi uykumuzu kaçıran soruyu da cevaplar: yeni sürüm neyi bozacak? Aday bir prompt, model veya kurulum, tek bir gerçek müşteriyle karşılaşmadan önce aynı persona'lara karşı sınanır. Demoda iyi görüneni değil, daha çok segment kazanan sürümü yayınlarsınız.
Müşteriyle konuşan bir agent işletiyorsanız ve raporlamanız tek bir sayıysa, ondan sessizce vazgeçen insanlar o sayının içindedir. quots'u onların adını koymak için yaptık.