Kullanılabilirlik testinde gerçek ya da olası kullanıcılara gerçekçi görevler verilir ve görevleri yaparken sesli düşünmeleri istenir; kolaylaştırıcı yönlendirmeden izler ve not alır. Test yüz yüze ya da uzaktan, moderasyonlu ya da moderasyonsuz yapılabilir. Bulunan sorunlar sıklık, etki ve süreklilik açısından önem derecesine göre sıralanır.
Bir arayüzde neyin işleyip neyin işlemediğini anlamanın en doğrudan yolu, insanların onu kullanmasını izlemektir. Kullanılabilirlik testi bunun yapılandırılmış hâlidir. Bu yazı kullanılabilirliğin ne anlama geldiğini, test türlerini, görev yazımını, oturumu yürütmeyi ve bulguları önceliklendirmeyi anlatıyor.
Kullanılabilirlik nedir? ISO 9241-11 tanımı
Kullanılabilirliğin uluslararası referans tanımı ISO 9241-11 standardındadır. Standardın güncel sürümü 2018'de yayımlanan ikinci baskıdır; ISO sayfasına göre 2023'te yeniden gözden geçirilip onaylanmıştır ve hâlâ geçerlidir 1. W3C'nin aktardığı tanıma göre kullanılabilirlik, bir ürünün belirli kullanıcılar tarafından belirli hedeflere belirli bir kullanım bağlamında etkili, verimli ve memnuniyetle ulaşmak için kullanılabilme derecesidir 2.
Tanımdaki üç ölçüt teste doğrudan karşılık gelir:
- Etkinlik: Kullanıcı hedefe ulaşabildi mi? Görev başarısı bu ölçütün en yaygın göstergesidir.
- Verimlilik: Hedefe ulaşmak için ne kadar emek, zaman ve adım gerekti?
- Memnuniyet: Kullanıcı deneyimi nasıl algıladı?
Tanımdaki "belirli kullanıcılar" ve "belirli bağlam" ifadeleri de önemlidir: bir arayüz bir grup için kolay, başka bir grup için zor olabilir. ISO 9241-11 bir kavram çerçevesi sunar; tasarım ya da değerlendirme için belirli bir yöntem tarif etmez 1. Yöntem tarafını aşağıdaki adımlar dolduruyor.
Testin üç öğesi ve türleri
NN/g'ye göre çoğu kullanılabilirlik testinin üç temel öğesi vardır: kolaylaştırıcı (moderatör), görevler ve katılımcı 3. Kolaylaştırıcı görevleri verir, katılımcıyı izler, gerektiğinde takip sorusu sorar; bunu yaparken katılımcının davranışını istemeden etkilememesi gerekir 3.
Testler iki eksende ayrılır:
| Tür | Ne yapar | Ne zaman uygun |
|---|---|---|
| Nitel | Sorunları, nedenlerini ve gözlemleri toplar | Tasarımı iyileştirirken; en yaygın tür |
| Nicel | Görev başarısı, görev süresi gibi metrikleri ölçer | Kıyaslama ve zaman içinde izleme için |
| Yüz yüze | Kolaylaştırıcı ve katılımcı aynı odada | Beden dilini okumak önemliyse |
| Uzaktan moderasyonlu | Aynı anda, farklı yerlerde; ekran paylaşımıyla | Dağınık kullanıcılar, kısıtlı bütçe ve zaman |
| Uzaktan moderasyonsuz | Katılımcı görevleri kendi başına, kendi zamanında yapar | Belirli bir öğe ya da küçük değişiklik |
Tablodaki ayrımlar NN/g'nin açıklamalarına dayanıyor 3 5. NN/g mümkün olduğunda yüz yüze testi tercih ettiğini, ama bütçe ya da zaman yüz yüze teste izin vermiyorsa uzaktan testin testi hiç yapmamaktan çok daha iyi olduğunu belirtiyor 5.
Moderasyonsuz testin iki zayıf noktası var: kullanıcıya özel takip sorusu sorulamaz ve sessiz kalan katılımcıya sesli düşünmesini hatırlatacak kimse yoktur. Bu yüzden genel bir değerlendirmeden çok, birkaç belirli öğeye odaklanan çalışmalar için önerilir 5. Moderasyonlu uzaktan testte ise karşı taraftaki sessizliğin kafa karışıklığı mı, okuma mı, dikkat dağınıklığı mı olduğunu anlamak yüz yüze teste göre zordur 5.
Testi planlamak
GOV.UK, oturumları planlamadan önce ekiple birlikte araştırma sorularını, test edilecek kullanıcı türlerini ve prototipin ya da hizmetin hangi bölümlerine odaklanılacağını netleştirmeyi öneriyor 8. Bunlar belli olduktan sonra şu kararlar verilir 8:
- Katılımcılar kimler olacak? Hizmetin gerçek ya da olası kullanıcıları olmalı.
- Oturumlar nerede yapılacak? Laboratuvar, toplantı odası ya da uzaktan.
- Mekân katılımcılar için erişilebilir mi, tercüman ya da yardımcı gerekiyor mu?
- Oturumlar kaydedilecek mi, nasıl?
- Hangi ekip üyeleri gözlemci olacak, her oturumda notları kim alacak?
Planlamanın genellikle atlanan bir kararı test verisidir. GOV.UK, mümkün olduğunda katılımcıların kendi verileri ve belgeleriyle görev yapmasını öneriyor; böylece göreve daha çok dahil olurlar ve bağlama dair daha fazla sorun ortaya çıkar. Bu ancak prototip gerçek veriyi işleyebiliyorsa ve kişisel veriyi güvenle koruyabiliyorsanız mümkündür; aksi hâlde katılımcıya oynayacağı bir karakter ve o karaktere ait örnek belgeler hazırlanır 8. Bir bankacılık prototipinde gerçek hesap bilgisi yerine kurgusal bir müşteri profili ve örnek hesap hareketleri hazırlamak bu yaklaşıma örnektir.
Uzaktan test yapacaksanız NN/g'nin dört pratik önerisi de plana girmeli: kullanacağınız aracı şirket dışından biriyle gerçek bir oturum gibi deneyin, tüm görev metinlerini önceden yazıp pilotla sınayın, moderasyonsuz testlerde bile katılımcının ulaşabileceği bir iletişim kanalı açık tutun ve gelmeyen ya da kullanılamayan oturumlar için ihtiyacınızdan birkaç fazla katılımcı davet edin 5.
Görev senaryosu yazmak
Testin kalitesini en çok görev metinleri belirler. NN/g, görev metnindeki küçük ifade hatalarının katılımcının görevi yanlış anlamasına ya da davranışının etkilenmesine (priming) yol açabileceğini vurguluyor 3. İyi bir görev senaryosu için üç kural öneriliyor 6:
- Gerçekçi olsun. Katılımcının normalde yapmayacağı bir şeyi istemeyin; kendi kriterleriyle karar verebileceği alan bırakın.
- Eyleme dönük olsun. "Nereye tıklardınız?" diye sormayın; görevi yaptırın. İnsanların anlattığı ile yaptığı aynı değildir.
- İpucu vermesin. Adımları tarif etmeyin, arayüzdeki etiketleri görev metninde kullanmayın.
Aşağıdaki örnekler bir sigorta uygulaması için kurgulanmıştır:
| Zayıf görev (örnek) | Daha iyi görev (örnek) |
|---|---|
| "Menüden Poliçelerim'e girip kasko poliçenizi açın." | "Aracınızın sigortasının ne zaman bittiğini öğrenin." |
| "Hasar Bildir butonuna basarak bir bildirim oluşturun." | "Dün park hâlindeyken aracınıza çarpıldı. Bunu sigorta şirketinize bildirin." |
| "Bir poliçe satın alacak olsaydınız ne yapardınız?" | "Eşinizin aracı için 5 Ocak'tan başlayan bir trafik sigortası teklifi alın." |
Görev ipucu vermemeli ama belirsiz de olmamalı: katılımcının görevi tamamlamak için ihtiyaç duyduğu bilgiyi verin, yalnız nereye tıklayacağını söylemeyin 6. GOV.UK de iyi görevlerin net bir hedef koyduğunu, katılımcıya inandırıcı geldiğini, sorunları ortaya çıkaracak kadar zorlayıcı olduğunu ve cevabı vermediğini belirtiyor 8.
Sesli düşünme ve oturumu yürütmek
Sesli düşünme (think-aloud), katılımcının arayüzü kullanırken düşüncelerini sürekli sesli ifade etmesidir. Nielsen bu yöntemi en değerli kullanılabilirlik yöntemi olarak tanımlıyor ve temel bir çalışma için üç şey sayıyor: temsilî kullanıcılar bulmak, onlara temsilî görevler vermek ve susup kullanıcıların konuşmasına izin vermek 4.
Yöntemin güçlü yanları düşük maliyet, esneklik ve ikna gücüdür: kâğıt prototipten çalışan ürüne kadar her aşamada kullanılabilir ve ekibin oturumları izlemesi kullanılabilirliğe dikkat çekmenin en etkili yollarından biridir 4. Sınırları da var: sürekli konuşmak doğal değildir, katılımcılar akıllı görünmek için düşüncelerini süzebilir ve eğitimsiz bir kolaylaştırıcının araya girmesi davranışı değiştirebilir 4.
GOV.UK'nin oturum önerileri şöyle özetlenebilir 8:
- Oturumlar genellikle 30-60 dakika sürer; bir günde bir saatlik en fazla altı oturum ve aralarında en az 15 dakika planlayın.
- Başlamadan önce katılımcının rahatlamasına zaman tanıyın ve test edilenin kendisi değil hizmet olduğunu söyleyin.
- Görevleri net ve nötr bir dille verin, mümkünse katılımcının hayatına uyarlayın.
- Çoğunlukla sessiz kalın; yalnız ilginç bir şeyi anlamak ya da tamamen takılan katılımcıyı yola döndürmek için araya girin.
- Görüş ve önerileri "Bunu neden söylediniz?" gibi açık sorularla derinleştirin.
- Oturum sonunda anlamadığınız gözlemler için takip soruları sorun.
Oturumu kaydetmeden önce katılımcının bilgilendirilmiş onayını alın ve kayıtları güvenle saklayın; bu konuyu UX araştırması nasıl yapılır yazısında KVKK boyutuyla ele aldık.
Bulguları önem derecesine göre sıralamak
Test sonunda çoğu zaman düzeltilebilecek olandan fazla sorun listelenir. Nielsen'e göre bir sorunun önem derecesi üç etkenin birleşimidir: sıklık (sorun ne kadar yaygın), etki (karşılaşan kullanıcı aşabiliyor mu) ve süreklilik (bir kez öğrenince aşılıyor mu, yoksa her seferinde mi rahatsız ediyor) 7. Önerilen 0-4 ölçeği şöyledir 7:
- 0: Kullanılabilirlik sorunu olduğu konusunda hemfikir değilim.
- 1: Yalnız kozmetik; fazladan zaman yoksa düzeltilmesi gerekmez.
- 2: Küçük sorun; düşük öncelik.
- 3: Büyük sorun; düzeltilmesi önemli, yüksek öncelik.
- 4: Kullanılabilirlik felaketi; ürün yayına girmeden mutlaka düzeltilmeli.
Nielsen, tek bir değerlendiricinin verdiği önem derecelerinin güvenilmez olduğunu, birkaç kişinin bağımsız puanlarının ortalamasının çok daha sağlam sonuç verdiğini belirtiyor 7. Bulgu raporunda her sorun için gözlem, kaç katılımcıda görüldüğü, önem derecesi ve önerilen değişiklik yer almalı. Test bulgularını ürün metrikleriyle birlikte izlemek için UX metrikleri yazısına bakabilirsiniz.
Test ne zaman ve ne sıklıkla yapılmalı?
Tek bir büyük test yerine sık ve küçük testler daha çok şey öğretir. NN/g nitel bir çalışmada tek bir kullanıcı grubu için beş katılımcıyla en yaygın sorunların çoğunun bulunabileceğini belirtiyor 3; bu sayının sınırlarını kaç kullanıcıyla test yapılmalı yazısında ayrıntılı ele alıyoruz. Test sonrası tasarımı düzeltip yeniden test etmek, düzeltmenin gerçekten işe yarayıp yaramadığını gösterir.
Kullanıcı bulmadan önce bariz sorunları temizlemek isterseniz sezgisel değerlendirme iyi bir ön adımdır. Uzaktan, moderasyonlu testlerin planlanmasından bulgu raporuna kadar süreci kullanılabilirlik testi sayfamızda anlatıyoruz.
Sık sorulan sorular
Hayır. Sesli düşünme yöntemi kâğıt prototipten tıklanabilir prototipe, canlı ürüne kadar her aşamada kullanılabilir. Hatta erken test daha değerlidir; yapısal bir sorunu prototipte düzeltmek, geliştirilmiş üründe düzeltmekten çok daha kolaydır. Prototip yalnız test edilecek görevleri kapsasa da yeterlidir.
Ana akışları ilk kez test ediyor, neden sorusuna cevap arıyor ve takip sorusu sormak istiyorsanız moderasyonlu test daha uygundur. Belirli bir öğeyi ya da küçük bir değişikliği hızlıca denemek, katılımcıların kendi zamanlarında katılmasını sağlamak istiyorsanız moderasyonsuz test işe yarar. Moderasyonsuz testte görev metinleri tek başına anlaşılır olmalıdır; yanlış anlaşılırsa düzeltecek kimse yoktur.
GOV.UK, moderasyonlu test oturumlarının görev sayısı ve karmaşıklığına göre genellikle 30 ile 60 dakika arasında sürdüğünü belirtiyor. Bir günde bir saatlik en fazla altı oturum planlanması ve oturumlar arasında en az 15 dakika bırakılması öneriliyor. Teste kısa bir görüşme ekliyorsanız oturum uzar.
Mümkün olduğunca hayır. Katılımcıyı belirli bir yere yönlendirmek test sonucunu bozar. Ancak katılımcı tamamen takıldıysa ve devam edemiyorsa, geri kalan görevlerden öğrenmeye devam etmek için onu yola geri döndürebilirsiniz. Bu durumu notlara yazın; o görev için başarı ölçümünü yardım sonrası verilerle karıştırmayın.
Hayır. Kullanılabilirlik testi az sayıda katılımcıyı izleyerek sorunların neden ortaya çıktığını anlamaya çalışır. A/B testi ise canlı üründe iki tasarımı rastgele kullanıcı gruplarına gösterip davranıştaki farkı ölçer. Biri neden sorusuna, diğeri hangisi daha iyi sonuç veriyor sorusuna cevap verir; birbirinin yerine geçmezler.
Kaynaklar
- 1ISO. ISO 9241-11:2018 Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts
- 2W3C WAI. Accessibility, Usability, and Inclusion
- 3Nielsen Norman Group. Usability (User) Testing 101
- 4Nielsen Norman Group. Thinking Aloud: The #1 Usability Tool
- 5Nielsen Norman Group. Remote Usability Tests: Moderated and Unmoderated
- 6Nielsen Norman Group. Turn User Goals into Task Scenarios for Usability Testing
- 7Nielsen Norman Group. Severity Ratings for Usability Problems
- 8GOV.UK Service Manual. Using moderated usability testing
uiuxtasarim Editör Ekibi
Bu yazı ekibimizin editoryal sürecinden geçti: kaynaklar tek tek doğrulandı, sayısal iddialar kaynağa bağlandı. Yayın ilkelerimiz
Kullanılabilirlik Testi
Gerçek kullanıcılara gerçek görevler verin; nerede takıldıklarını görün, önceliklendirilmiş bulguyla düzeltin.
