Yapay zekâ pilot projesinde başarı nasıl ölçülür?
Bir taslağın birkaç saniyede hazırlanması etkileyici görünebilir. Ancak onu kullanılır hâle getirmek için ne kadar kontrol ve düzeltme gerektiğini bilmiyorsanız işin gerçekten kolaylaşıp kolaylaşmadığını da bilmiyorsunuzdur.
Pilotun çözmeyeceği işleri de yazın
“Yapay zekâyı deneyelim” yerine bir görev seçin: belirli türdeki belgelerden alan çıkarmak veya kaynak metinden ilk haber taslağını hazırlamak gibi. Hangi girdi türlerinin kapsamda olduğunu ve hangi çıktıların inceleneceğini belirtin. Pilotun dışında kalan işleri de listeleyin.
Temsili bir belge pilotunda yalnızca okunabilir metin dosyaları ele alınıyorsa taranmış görüntülerden gelen başarısızlığı aynı sonuç havuzuna koymayın. Önce kapsamın değişip değişmediğini değerlendirin. Aksi hâlde model, veri hazırlığı ve kullanım sorunu tek bir puanda birbirine karışır.
Başlangıç durumunu ölçmeden kazanç söylemeyin
Mevcut yöntemde aynı tür işin nasıl yapıldığını gözlemleyin. Hazırlık, kontrol ve düzeltme sürelerini ayırın. Uzmanlığın veya dosya zorluğunun süreyi değiştirdiği durumları not edin. Bir kolay örneği bir zor örnekle karşılaştırmak, yeni sistem hakkında yanıltıcı bir izlenim yaratabilir.
Başlangıç verisi kusursuz olmak zorunda değildir, fakat nasıl toplandığı açık olmalıdır. Süre tahmini ile ölçülen süreyi karıştırmayın. Kullanıcı “daha rahat oldu” diyorsa bu değerli bir geri bildirimdir; yine de onu doğrudan sayısal zaman kazancı olarak raporlamayın.
Hata türlerini işin etkisine göre ayırın
Biçim bozukluğu, eksik alan ve kaynakta bulunmayan bilgi aynı tür hata değildir. Bir yazım düzeltmesi kolayca yapılabilirken yanlış kişi veya tutar bütün çıktının yeniden kontrol edilmesini gerektirebilir. Kabul ölçütünü işin sorumlusu ile belirleyin.
- Doğrudan kullanılabilir: Tanımlanan incelemeden sonra ek düzeltme gerektirmeyen çıktı.
- Düzeltmeyle kullanılabilir: Hatası belirlenip giderilebilen çıktı.
- Yeniden hazırlanmalı: İş için yeterli olmayan veya güvenle düzeltilemeyen çıktı.
Bu sınıflar bir öneridir; görevinize göre değiştirebilirsiniz. Amaç, tek bir ortalamanın önemli hata türlerini gizlemesini önlemektir.
Test kümesini sunum örnekleriyle sınırlamayın
Normal örneklerin yanında eksik, çelişkili ve beklenmeyen girdiler hazırlayın. Modelin cevabı bilmediğinde veya kaynak yetersiz olduğunda ne yaptığını da görün. Örneklerin bir kısmını ayarlama sırasında kullanıp kalanıyla sonucu değerlendirmek, yalnızca bilinen örneklere göre karar verme riskini azaltabilir.
Girdi, kullanılan ayar veya model sürümü ve değerlendirme sonucunu birlikte kaydedin. Bir değişiklikten sonra hangi örneğin iyileştiğini, hangisinin bozulduğunu böylece karşılaştırabilirsiniz. Gerçek kişilere ait gereksiz verileri test kümesine taşımadan çalışma örnekleri hazırlayın.
Pilotun sonunda üç olası karar vardır
Kapsamı genişletmek tek olumlu sonuç değildir. Aynı kapsamda iyileştirme yapmak veya otomasyonun bu adım için uygun olmadığına karar vermek de ölçümlere dayalı sonuçlardır. Sorun kaynak bilgisindeyse modeli değiştirmek yerine veri düzenini iyileştirmek gerekebilir.
Son değerlendirmede sonucu kullanacak kişiyi, operasyon sorumlusunu ve teknik ekibi bir araya getirin. Hangi koşullarda sistemin duracağı, insan incelemesine döneceği ve yeniden değerlendirileceği belli olsun. Pilottaki sonucu tüm ürünlere veya gelecekteki her iş yüküne genellemeden, yalnızca ölçtüğünüz kapsam için ifade edin.
Bu rehber Ornitoreng tarafından yapay zekâ desteğiyle hazırlanmıştır. Örnekler temsili iş akışlarıdır; müşteri sonucu veya ürün performansı iddiası değildir.
Ornitoreng