uiuxtasarım
Araştırma ve Test

Kaç Kullanıcıyla Test Yapılmalı? 5 Kullanıcı Kuralı ve Sınırları

Kullanılabilirlik testinde 5 kullanıcı kuralı nereden geliyor, ne zaman geçerli? Nicel çalışmalar, farklı kullanıcı grupları ve görüşmeler için sayılar.

Yayın
Okuma
7 dk
Kaynak
8
Kaç Kullanıcıyla Test Yapılmalı? 5 Kullanıcı Kuralı ve Sınırları
Kısa cevap

Nitel bir kullanılabilirlik testinde tek bir kullanıcı grubu için 5 katılımcı çoğu zaman yeterlidir; ama kural yalnız bu durum için geçerlidir. Belirgin biçimde farklı kullanıcı grupları varsa her gruptan 3-4 kişi, metrik toplayan nicel çalışmalarda NN/g'nin güncel önerisine göre yaklaşık 40 katılımcı gerekir. Keşif görüşmelerinde sayı doygunluğa göre belirlenir.

"Beş kullanıcı yeter" UX dünyasının en çok bilinen ve en çok yanlış uygulanan kurallarından biridir. Kural bazı ekiplerde testin hiç yapılmamasına karşı iyi bir argümandır; bazı ekiplerde ise her tür araştırma için sabit bir sayıya dönüşür. Bu yazı kuralın nereden geldiğini, neden işe yaradığını ve hangi durumlarda yetersiz kaldığını anlatıyor.

5 kullanıcı kuralı nereden geliyor?

Kural, Jakob Nielsen ile Tom Landauer'in 1993'te yayımladığı bir matematiksel modele dayanıyor. Modelde tek bir kullanıcıyla yapılan testin bir arayüzdeki sorunların ne kadarını bulduğu L ile gösterilir; Nielsen'in incelediği çok sayıda projede L'nin tipik değeri yüzde 31'dir 1. Bu değerle çizilen eğri şunu gösterir:

  • İlk kullanıcıyla sorunların neredeyse üçte biri görülür.
  • Her yeni kullanıcı bir kısmı tekrar eden, bir kısmı yeni gözlemler getirir; yeni bilgi giderek azalır.
  • Beş kullanıcıda sorunların yaklaşık yüzde 85'i bulunmuş olur.
  • Tüm sorunları görmek için en az 15 kullanıcı gerekir 1.

Nielsen'in asıl önerisi bu son maddeden çıkıyor: 15 kişilik bir bütçeniz varsa onu tek bir teste harcamak yerine, aralarında tasarımın düzeltildiği beşer kişilik üç teste bölün 1. İkinci test, ilk testteki düzeltmelerin işe yarayıp yaramadığını gösterir, kalan sorunların çoğunu bulur ve yüzeydeki sorunlar temizlendiği için bilgi mimarisi ve görev akışı gibi daha derin konulara inebilir 1.

Neden bir kişiyle değil de beşle? Nielsen iki sebep veriyor: tek bir kişinin rastlantısal ya da temsil edici olmayan davranışı yanıltabilir ve her çalışmanın sabit bir planlama maliyeti vardır; bu maliyeti birkaç kullanıcıya yaymak daha verimlidir 1.

Kural ne zaman geçerli?

Nielsen 2012'de konuya geri döndüğünde cevabı "5, olmadığı durumlar hariç" diye özetledi 2. Kuralın geçerli olduğu koşullar şunlar:

  1. Çalışma nitel olmalı. Amaç sayı değil, tasarımı yönlendirecek içgörüdür.
  2. Katılımcılar tek bir kullanıcı grubundan olmalı. Model, ürünü benzer biçimde kullanan, birbirine benzeyen kullanıcılar için geçerlidir 1.
  3. Test yinelemeli bir sürecin parçası olmalı. Bir sürümde kalan sorunlar bir sonraki turda yakalanır; kural tek seferlik bir test için tasarlanmamıştır 2.

Nielsen aynı yazıda NN/g'nin 83 danışmanlık projesini de gösteriyor: daha fazla kullanıcıyla test edilen çalışmalar belirgin biçimde daha fazla bulgu üretmemiş 2. Bir web sitesinin milyonlarca kullanıcısı olması da örneklem büyüklüğünü değiştirmez; istatistikte belirleyici olan örneklemin büyüklüğüdür, evrenin büyüklüğü değil 2. Çok sayıda özellik ise daha büyük bir test değil, her biri farklı bir özellik kümesine odaklanan birkaç test gerektirir; tek bir katılımcı birkaç görevden sonra yorulur 2.

Sayı bazen 5'in altına da inebilir. Süreç maliyeti çok düşük, çevik bir ekipte çalışma başına 2 kullanıcı bile en iyi getiriyi verebilir; bazı projelerde ise 8 ya da daha fazla kullanıcı daha uygun olabilir 2.

Farklı kullanıcı grupları

Ürününüzü birbirinden belirgin biçimde farklı gruplar kullanıyorsa, beş kişiyi tek bir havuzdan seçmek yetmez. Nielsen'in örnekleri hem doktorlara hem hastalara hitap eden bir sağlık sitesi ve hem alıcıların hem satıcıların kullandığı bir açık artırma sitesidir 2. Türkiye'den kurgusal bir örnek: bir kargo uygulamasında gönderi takip eden bireysel müşteri ile toplu gönderi oluşturan e-ticaret satıcısı.

Bu durumda öneri şöyle 1:

DurumGrup başına katılımcıToplam
Tek kullanıcı grubu55
İki farklı grup3-46-8
Üç ya da daha fazla grup39 ve üzeri

Gruplar arasında davranış kısmen örtüştüğü için her grubu beşer kişiyle ayrı ayrı test etmek gerekmez. Örneğin acemi, orta düzey ve deneyimli yatırımcılara hitap eden bir finans sitesinde her gruptan 3 kişi, toplam 9 kullanıcı yeterlidir 2. Ancak bir grubun davranış çeşitliliğini görmek için grup başına üçün altına inmemek gerekir 1.

Bu ayrım yalnız gruplar ürünü gerçekten farklı biçimde kullanıyorsa geçerlidir. Yaş ya da şehir gibi demografik farklar tek başına ayrı bir grup gerektirmez; belirleyici olan görevlerin ve ihtiyaçların farklılaşmasıdır.

Nicel çalışmalar: 20 değil, çoğunlukla 40

Sayının en çok değiştiği yer nicel çalışmalardır. Amaç sorun bulmak değil, görev başarısı ya da görev süresi gibi bir metriği güvenilir biçimde ölçmekse, beş kullanıcı çok gürültülü bir sonuç verir.

NN/g'nin bu konudaki önerisi zaman içinde değişti. Nielsen 2006'da, web sitelerinde görev süresinin standart sapmasının ortalamanın yaklaşık yüzde 52'si olduğunu hesaplayarak nicel çalışmalar için 20 kullanıcı önermişti; bu sayı yüzde 90 güven düzeyinde yaklaşık yüzde 19'luk bir hata payı kabul ediyordu 4. 2021'de yayımlanan özet ise çoğu nicel çalışma için 40 katılımcı öneriyor 3. Bu sayı, büyük bir kullanıcı kitlesi, görev başarısı gibi ikili bir metrik, yüzde 15 hata payı ve yüzde 95 güven düzeyi varsayımından çıkıyor; hesap 39 veriyor ve 40'a yuvarlanıyor 3.

Ne kadar risk ve hata payı kabul ettiğinize göre sayı değişir 3:

Güven düzeyiHata payıİkili metrik (başarı)Yalnız sürekli metrik (süre, memnuniyet)
%95%153947
%95%202126
%90%152833
%90%201519

NN/g, yüzde 20'den büyük hata paylarını önermiyor; güven aralığı o kadar genişler ki sonuç pek işe yaramaz 3. Sıkça duyulan "30 kullanıcı" önerisinin kaynağı da bu tablodur: yüzde 90 güven düzeyi ve yüzde 15 hata payı, yani biraz daha fazla risk 3. Bütçe kısıtlıysa önerilen yol, 20-25 kullanıcıyla başlamak, hata paylarını hesaplamak ve yetmiyorsa çalışmanın geçerliliği bozulmadan kısa sürede ek katılımcı eklemektir 3.

Nicel testler nitel testlere göre hem pahalıdır hem de hataya açıktır; NN/g, kuruluşların ilk çalışmalarının nitel olmasını ve nicel çalışmaların ancak düzenli nitel araştırma yerleştikten sonra eklenmesini öneriyor 4. NN/g'nin karşılaştırmasına göre nitel testler çoğunlukla 5-8 kullanıcıyla, nicel testler ise çoğunlukla 30'dan fazla katılımcıyla yapılıyor 5. Hangi metriklerin toplanacağını UX metrikleri yazısında ele alıyoruz.

Nielsen 2012 yazısında iki özel durum için de sayı veriyor: kart sıralamada kullanıcı grubu başına en az 15, kararlı ısı haritaları isteyen göz izleme çalışmalarında 39 kullanıcı 2.

Görüşmeler ve diğer yöntemler

5 kullanıcı kuralı bir kullanılabilirlik testi kuralıdır; her araştırma yöntemine taşınmamalı. NN/g, keşif amaçlı görüşmelerde aranan bilginin bir arayüzdeki sorunlardan çok daha çeşitli olduğunu, bu yüzden doygunluk noktasına daha geç ulaşıldığını ve 5 görüşmenin çoğu zaman yetmediğini belirtiyor 6. Önerilen yöntem, 5-6 kişilik temsilî bir grupla başlamak, görüşmeleri yaptıkça analiz etmek ve yeni tema çıkmadığında durmaktır 6. Araştırma sorusu genişledikçe ve katılımcı grubu çeşitlendikçe gereken sayı artar; dar kapsamlı ve benzer katılımcılarla yapılan bir çalışmada ise 5 görüşme yetebilir 6. Görüşme sürecinin ayrıntıları için kullanıcı görüşmesi nasıl yapılır yazısına bakabilirsiniz.

GOV.UK'nin genel kuralı da benzer bir aralık veriyor: bir görüşme ya da kullanılabilirlik testi turu için tipik olarak 4 ile 8 arasında katılımcı 7. Paydaşlar baştan bir sayı istiyorsa, sabit bir rakam yerine bir aralık vermek ve doygunluğa erken ulaşılırsa durulabileceğini önceden söylemek beklentiyi doğru kurar 6.

Katılımcı sayısını planlarken

Hedef sayıyı belirledikten sonra davet edeceğiniz kişi sayısını ayrıca düşünün. Uzaktan çalışmalarda gelmeme oranı yüz yüze çalışmalara göre daha yüksek olabilir; moderasyonsuz testlerde ise bir oturumun kullanılabilir olup olmadığını ancak kaydı izledikten sonra anlarsınız. NN/g bu yüzden ihtiyacınızdan birkaç fazla katılımcı davet etmeyi öneriyor 8.

Sonuç: sayıdan önce soru

Doğru katılımcı sayısı, araştırmanın sorusundan çıkar. Sorun bulmak istiyorsanız küçük ve sık testler, ölçmek istiyorsanız istatistiksel olarak yeterli bir örneklem, anlamak istiyorsanız doygunluğa kadar süren görüşmeler gerekir. Testin kendisini nasıl kuracağınızı kullanılabilirlik testi nasıl yapılır yazısında anlattık; tur sayısı ve katılımcı planını birlikte netleştirmek isterseniz kullanılabilirlik testi sayfamıza göz atabilirsiniz.

Sık sorulan sorular

Hayır. Nielsen ve Landauer'in modeline göre beş kullanıcı, tek bir kullanıcı grubunda sorunların yaklaşık yüzde 85'ini ortaya çıkarır. Tüm sorunları görmek için modele göre en az 15 kullanıcı gerekir. Nielsen'in önerisi bu 15 kişiyi tek bir büyük teste değil, aralarında tasarımın düzeltildiği beşer kişilik üç teste bölmektir.

NN/g'nin 2021 tarihli özetine göre çoğu nicel çalışma için 40 katılımcı uygun bir sayıdır. Bu sayı, görev başarısı gibi ikili bir metrik için yüzde 95 güven düzeyi ve yüzde 15 hata payı varsayımından gelir. Daha fazla risk kabul ederseniz, örneğin yüzde 90 güven düzeyinde, sayı 28'e iner. Eski NN/g yazılarındaki 20 kullanıcı önerisi daha geniş bir hata payı kabul eder.

Gruplar ürünü gerçekten farklı biçimde kullanıyorsa her gruptan katılımcı gerekir. Nielsen iki grup için grup başına 3-4, üç ya da daha fazla grup için grup başına 3 kullanıcı öneriyor. Gruplar arasında davranış örtüştüğü için her grubu beşer kişiyle ayrı ayrı test etmek gerekmez; ama hiçbir grupta üçün altına inmeyin.

Genellikle değil. NN/g, 5 kullanıcı kuralının kullanılabilirlik testinden geldiğini, keşif amaçlı görüşmelerde aranan bilgi daha çeşitli olduğu için 5 kişinin çoğu zaman az kalabileceğini belirtiyor. 5-6 görüşmeyle başlayıp analiz ederek ilerlemek ve yeni tema çıkmadığında durmak öneriliyor.

Uzaktan çalışmalarda katılımcının gelmeme oranı yüz yüze çalışmalara göre daha yüksek olabilir. Moderasyonsuz testlerde ise bir oturumun kullanılabilir olup olmadığını ancak kaydı izledikten sonra anlarsınız. NN/g bu yüzden ihtiyaç duyduğunuzdan birkaç fazla katılımcı davet etmeyi öneriyor.

Kaynaklar

  1. 1Nielsen Norman Group. Why You Only Need to Test with 5 Users
  2. 2Nielsen Norman Group. How Many Test Users in a Usability Study?
  3. 3Nielsen Norman Group. How Many Participants for Quantitative Usability Studies: A Summary of Sample-Size Recommendations
  4. 4Nielsen Norman Group. Quantitative Studies: How Many Users to Test?
  5. 5Nielsen Norman Group. Quantitative vs. Qualitative Usability Testing
  6. 6Nielsen Norman Group. How Many Participants for a UX Interview?
  7. 7GOV.UK Service Manual. Finding participants for user research
  8. 8Nielsen Norman Group. Remote Usability Tests: Moderated and Unmoderated

uiuxtasarim Editör Ekibi

Bu yazı ekibimizin editoryal sürecinden geçti: kaynaklar tek tek doğrulandı, sayısal iddialar kaynağa bağlandı. Yayın ilkelerimiz

İlgili hizmet

Kullanılabilirlik Testi

Gerçek kullanıcılara gerçek görevler verin; nerede takıldıklarını görün, önceliklendirilmiş bulguyla düzeltin.

İncele
Sonraki adım

Ürününüzü birlikte inceleyelim

Görüşmede ürününüzü, kullanıcılarınızı, takıldıkları yerleri ve ekibinizin yapısını konuşur; yazılı bir kapsam, yöntem ve takvim önerisi çıkarırız. Bağlayıcı değildir.

WhatsAppGörüşme Planla