Hangi kanıt bir kararı hak eder?
Ampirik bulguları, değerleri, kurumsal amacı ve risk toleransını birbirinden ayırmak ve gerekçeli biçimde birleştirmek

Yönlendirici soru: Mevcut kanıt ne zaman kurumsal bir kararı taşır ve ayrıca hangi gerekçelerin açıkça ortaya konması gerekir?
“Daha fazla kanıt”ın tam bir yanıt olmadığı an
Tamamen kurgusal küçük bir sürekli eğitim kuruluşu, genel kurs sorularını bir dil modeliyle önceden sınıflandırmayı düşünüyor. Niyet makul görünüyor: Ekibin danışmanlığa daha çok zaman ayırabilmesi için rutin işler daha az zaman almalı. Bir toplantıda üç cümle söyleniyor: “Model, örneklerimizde şaşırtıcı derecede isabetli görünüyor.” “Farklı biçimde ifade eden ilgilileri gözden kaçırmak istemiyoruz.” “Daha hızlı olmazsak başvuruları kaybederiz.” Her cümle ilgili bir şeye işaret eder. Hiçbiri kuruluşun sistemi kullanıp kullanmaması gerektiği sorusunu tek başına yanıtlamaz.
“İsabetli” öncelikle gözlemlenen çıktılara ilişkin bir iddiadır. Tanımlı bir görev, karşılaştırma ölçütleri, veri ve bulgunun hangi durumlar için geçerli olduğuna dair sınırlı bir açıklama gerektirir. “Kimseyi gözden kaçırmamak” normatif bir yükümlülüktür: Hangi hata türlerine ve hangi etkilenen gruplara özel ağırlık verilmesi gerektiğini söyler. “Daha hızlı olmak” kurumsal bir amaçtır. Anlamlı olabilir, gerekçelendirilebilir ve başka amaçlarla çatışabilir. Kalan hata tehlikesinin taşınabilir olup olmadığı ise kullanım, sonuçlar ve düzeltme olanaklarına uyması gereken risk toleransı meselesidir.
Güçlük, bu kayıtlar fark edilmeden birbirinin içine geçtiğinde başlar. Olumlu bir test ahlaki gerekçe olarak ele alınır; ekonomik bir amaç sözde bir ölçüme dönüştürülür; özellikle ihtiyatlı bir değer ölçütü “kötü veri kalitesi” sayılır; ya da iyi bir ortalama sonuç her tekil sonucu mazur göstermeye çalışır. Bunların tümü, kimse kasıtlı olarak yanıltmasa da yaşanabilir. Tam da bu nedenle iyi bir karar, görünür bir gerekçelendirme yapısına ihtiyaç duyar.
Bu makalenin ana tezi şudur: Ampirik kanıt, olgusal iddiaları destekleyebilir ve eylem olanaklarını sınırlayabilir. Ancak hangi sonuçların önem taşıdığını, kaynakların hangi amaca hizmet edeceğini veya bir kuruluşun belirtilmiş belirsizlik karşısında ne kadar sonuç riskini taşıyabileceğini tek başına belirlemez. Savunulabilir bir yapay zekâ kararı, bu farklı gerekçeleri görünür kılar, aralarındaki ilişkileri inceler ve karardan sorumlu olan kişi ya da rolü belirtir.
Burada sunulan dört kayıtlı form, didaktik ve editoryal bir araçtır. Ne istatistiksel bir ölçek ne de doğrulanmış bir yönetişim prosedürüdür; uzman incelemesinin yerini tutmaz. Amacı daha sınırlıdır: Tek bir göstergenin ya da ikna edici bir ifadenin bütün kararı taşıyor görünmesini önlemektir.
Dört kayıt, dört farklı görev
Belirsizlik altındaki bir karar, dört soru ayrı ayrı yanıtlandığında daha açık hâle gelir. Sonuçta bunlar bir araya getirilebilir; ancak gerekçeler görünür kalmalıdır.
| Kayıt | Soru | Gerekçelendirdiği | Gerekçelendirmediği |
|---|---|---|---|
| Ampirik kanıt | Kaynaklar, gözlemler veya testler hangi koşullarda ne gösteriyor? | Bir olgusal iddianın gücü, kapsamı ve sınırları | Hangi zararların ahlaki açıdan önemli olduğu veya hangi riskin kabul edilebilir olduğu |
| Normatif gerekçeler | Hangi haklar, çıkarlar, yükümlülükler, dağılımlar ve zararlar dikkate alınmalıdır? | Bazı sonuçların etkilenenler için neden önemli olduğu ve hangi sınırların geçerli olduğu | Bir olgusal iddianın doğru olduğu |
| Kurumsal amaç | Kuruluş hangi sorunu çözmek istiyor ve bu amaç nasıl gerekçelendiriliyor? | Bir seçeneğin neden dikkat ve kaynak hak ettiği | Haklara, koruma yükümlülüklerine veya geçerli kurallara bir istisna |
| Risk toleransı | Kuruluş, bu somut kullanımda ve belirtilmiş belirsizlik altında ne kadar kalan sonuç riskini taşıyabilir? | Eyleme geçme, deneme veya durdurma için kullanıma özgü bir sınır | Dayanak oluşturan kanıtın kalitesi veya doğruluk değeri |
1. Kanıtın bir geçerlilik kapsamına ihtiyacı vardır
“Test ettik” henüz yeterli bir bulgu değildir. İncelenebilir bir açıklama için en azından şunlar gerekir: Ne test edildi? Hangi vakalarda? Hangi referansa karşı? Hangi sürüm ve hangi prosedürle? Hangi vakalar eksikti? Hangi hata türleri görünür oldu, hangileri belki de olmadı? Bir bulgu, “modelin” genel bir özelliğini kanıtlamadan dar biçimde tanımlı bir görev için yararlı olabilir.
Dolayısıyla kanıt yalnızca “evet” ya da “hayır” biçiminde değildir. Bir iddiayı daha güçlü ya da daha zayıf destekleyebilir, belirli kullanımları dışlayabilir ve başka sorular açabilir. Veri ve prosedürler böyle bir sayıyı desteklemiyorsa belirsizliğe yapay bir sayısal değer verilmemelidir. “Bilinmiyor”, incelemenin durumu hakkında bilgidir; otomatik olarak iyimser bir varsayımla doldurulabilecek bir yer tutucu değildir.
Burada iki eşiği ayırmak gerekir. Epistemik eşik, bulgunun hangi iddiayı haklı çıkardığını sorar: örneğin bir iddianın iyi desteklenip desteklenmediğini, yalnızca geçici olarak makul olup olmadığını ya da açık kalıp kalmadığını. Eylem eşiği, olası sonuçlar, koruma yükümlülükleri ve düzeltme olanakları karşısında hangi seçeneğin sorumlu biçimde savunulabilir olduğunu sorar. Bir ekip, düşük sonuçlu ve geri döndürülebilir bir alıştırmada sınırlı kanıtla öğrenmeye devam edebilir; aynı kanıtı gerçek otomatik sınıflandırma için yetersiz görebilir. Tersine, kullanıma karşı açık bir bulgu, kuruluşun her belirsizliği bütünüyle çözmesi gerektiği anlamına gelmez. Eşikler ilişkilidir, ancak farklı soruları yanıtlar.
Bu ayrım yaygın bir sahte kesinliği önler: Bir test, dar biçimde tanımlı bir görev hakkında bulgu sağlayabilir. Bu bulgunun kapsamının planlanan karar için yeterli olup olmadığını otomatik olarak belirlemez. Bu nedenle her sonuç için bunun bir betimleme (“bu vakalarda X ortaya çıktı”), öngörü (“bu koşullarda Y bekliyoruz”) ya da öneri (“Z seçeneğini seçmeliyiz”) olup olmadığı açık olmalıdır. Bir cümle türünden diğerine geçen kişi ek varsayımları belirtmelidir.
2. Normatif gerekçeler etkilenenleri ve sonuçları adlandırır
Bir hata yalnızca bir tablodaki sapma değildir. İnsanları, ekipleri, süreçleri veya kamusal değerleri farklı biçimlerde etkiler. Yanlış bir sınıflandırma yalnızca küçük bir yönlendirme anlamına gelebilir; ancak acil ya da dil açısından alışılmadık bir sorunun daha geç görülmesine de yol açabilir. Bu sonuçların hepsi aynı ağırlıkta olmak zorunda değildir. Bunları değerlendiren kişi, hangi çıkarların ve koruma yükümlülüklerinin belirleyici olduğunu ve hangi bakış açısının şimdiye kadar eksik kaldığını belirtmelidir.
Değerler, proje planının sonunda yer alan süslü bir liste değildir. Karardan önce hangi hata türlerinin özellikle dikkatle incelenmesi gerektiğini ve hangi yan sonuçların salt maliyet kalemi olarak kaybolmaması gerektiğini belirleyebilirler. UNESCO, yapay zekâ etiği tavsiyesinde diğerlerinin yanı sıra insan onuru ve insan hakları, kapsayıcılık, orantılılık, katılım, sorumluluk ve insan gözetimini normatif referans noktaları olarak açıklar. Tavsiye, küresel ölçekte standart belirleyici, hukuken bağlayıcı olmayan bir çerçevedir. Otomatik bir tekil vaka kararı vermez; belirli bir sistemin ne etkisini ne de kabul edilebilirliğini kanıtlar.
3. Kurumsal bir amaç kanıt değildir
Bir kuruluş amaçlar belirleyebilir: örneğin erişilebilirlik, güvenilirlik, öğrenme kalitesi veya sürdürülebilir bir iş yükü. Bu amaçlar somut durum içinde birbirine karşı tartılmalıdır. Verimlilik önemli olabilir, ancak bunun için doğru çözümün yapay zekâ olup olmadığını henüz söylemez. Bir darboğazın nedeni belirsiz sorumluluklar, tutarsız şablonlar veya yetersiz zaman planlaması da olabilir.
Bu nedenle araçtan önce sorun tanımı gelir: Kimin için ne iyileşmelidir? Yapay zekâ dışı hangi seçenek aynı iyileşmeyi sağlayabilir? Bir amaç yatırımı anlaşılır kılar. Test edilmemiş bir faydayı ampirik olguya dönüştürmez.
4. Risk toleransı kullanıma uymalıdır
Risk toleransı, kanıtın kalitesi ya da serbestçe seçilebilecek bir onay sayısı değildir. Bir kuruluşun belirli bir kullanım durumunda, amaca ulaşmak için sonuç risklerini taşıyabileceği gerekçeli sınırdır. Bu risklerin ne kadar büyük olduğu, diğer etkenlerin yanında belirtilmiş kanıt belirsizliğine bağlıdır. İlgili sorular şunlardır: Olası zarar ne kadar ağır olurdu? Kaç kişi etkilenirdi? Adım geri döndürülebilir mi? Bir insan zamanında müdahale edebilir mi? Etkili bir şikâyet ya da düzeltme yolu var mı? Hangi kurallar ve haklar, ticari çıkardan bağımsız olarak hareket alanını sınırlıyor?
NIST AI Risk Management Framework 1.0 (2023), risk toleransını bağlama ve kullanıma bağlı olarak konumlandırır; kuruluşlara genel geçer bir eşik yazmaz. AI RMF 1.0 gönüllü, sektöre özgü olmayan bir yönetim çerçevesidir; ne uygulanabilir hukuk normlarının ne de ilgili değer ve zarar tartımının gerekçelendirilmesinin yerini alır. NIST, AI RMF 1.0’ın gözden geçirildiğini şu anda belirtmektedir. Bu makale için bu yüzden, sözde tamamlanmış bir 2026 yeni sürümü değil, 2023’te yayımlanan sürümdür.
Pratik bir sonuç şudur: Düşük sonuçlu, tamamen geri alınabilir bir keşif için otomatik dış iletişim, bir seçme kararı ya da hak ve fırsatları etkileyen bir süreçten farklı kanıt yeterli olabilir. Daha fazla belirsizlik otomatik olarak savunulamaz değildir; ancak daha dar bir eylem, daha açık koruyucu önlemler veya erteleme gerektirir. Bazen sorumlu karar, şimdilik karar vermemektir.

Felsefi bir gerilim: Değerler bilimde mi, yoksa ancak eylemde mi?
Değerlerin bilimsel yargılara girip girmediği ve nerede girdiği sorusu felsefi açıdan tartışmalıdır. Richard Rudner, ampirik hipotezlerin kabulü veya reddi sırasında olası hataların sonuçlarının rol oynadığını savunur: “yeterli kanıt” eşiği bazen hangi hataların ne kadar ağır olduğuna bağlıdır. Heather Douglas, tümevarımsal risk argümanını geliştirir. Buna göre epistemik olmayan değerler, olası hataların sonuçları hesaba katıldığında yöntemlerin ne kadar sıkı seçilmesi, verilerin nasıl nitelenmesi ve bulguların nasıl yorumlanması gerektiğini dolaylı olarak gerekçelendirebilir. Bunlar gözlemin yerini tutmaz ve istenen bir bulguyu kanıtlanmış bir bulgunun yerine koyamaz.
Güçlü bir karşı konum daha keskin bir ayrımı savunur. Richard Jeffrey, bir hipotezin kabulünü ya da reddini başlı başına bilimsel bir eylem olarak ele almamayı önerir: Kanıt, inanma derecelerini değiştirir; eylem kararları ayrıca sonuçları ve tercihleri hesaba katar. Bu güçlü bir ayrımcı konumdur. Böylece bir kuruluş aynı anda şunu söyleyebilir: “İddianın yeterince desteklenip desteklenmediğini henüz bilmiyoruz” ve “Muhtemelen doğru olsa bile, planlanan kullanım sonuçları nedeniyle savunulabilir değildir.”
Daniel Steel basit bir Jeffrey konumunu savunmaz. Tümevarımsal riskle uğraşırken epistemik ve epistemik olmayan değerlerin meşru ve gayrimeşru etkilerini ayırmanın temeli olarak bu değerlerin ayrımını savunur. Karşılaştırma felsefi gerilimi daha kesin kılar: Bir yanda sonuçların kanıt eşiğini belirlemeye katılıp katılamayacağı sorusu; diğer yanda epistemik değerlendirme ile pratik kararı daha güçlü biçimde ayırma girişimi.
Bu karşıtlık bir model formuyla çözülemez. Bunun yerine iki farklı düzeyi keskinleştirir:
1. Kanıt düzeyi: Verilerden ve yöntemlerden hangi ifade çıkar, hangisi çıkmaz?
2. Eylem düzeyi: Olası sonuçlar, yükümlülükler ve amaçlar karşısında hangi seçenek savunulabilir?
Dört kayıtlı form, hangi felsefi konumun kesin olarak doğru olduğuna karar vermez. Kanıt kalitesi ile normatif eylem eşiğini ayrı belgelendirerek karşı konumu ciddiye alır. Sonuçlara ilişkin soru, bir kuruluşun neden daha çok veya daha az güvence istediğini şeffaflaştırabilir. Bir ölçüm sonucunun içeriğini sonradan değiştiremez. Böylece her olgu sorusunu salt görüşe indirmeden değer çatışması görünür olur.
Neden toplam puan çoğu zaman yanlış kısayoldur
Kanıt gücünü, faydayı, riski ve çabayı ortak bir puana çevirmek caziptir. Tek bir değer karşılaştırılabilirlik ve hızlı bir sıralama vaat eder. Ancak ölçütler ve ağırlıklar nesnel olarak gerekçelendirilmemiş, önceden belirlenmemiş ve etkilenenler için izlenebilir değilse puan yalnızca çatışmayı bir formüle taşır. Ağır bir itiraz, birkaç küçük artı puanla hesap üzerinde kaybolabilir.
Bir görünüm seçenekleri yan yana koyabilir; ancak her kararın bir sıralamaya varması gerekmez. Özellikle eksik veya karşılaştırılamaz verilerde dışlama koşulları çoğu zaman daha yararlıdır: amacı netleşmeden kullanım yok; insan incelemesi olmadan dış etki yok; veri akışı ve sorumluluk netleşmediği sürece gerçek veri kümesi yok; tanımlı bir hata vakası ortaya çıkarsa veya gözetim artık çalışmazsa dur. Bu koşullar da gerekçe ister. Ancak hangi sınırın bir verimlilik kazancına karşı mahsup edilmemesi gerektiğini görünür kılar.
“Nispeten düşük risk” gibi nitel bir ifade de tek başına yeterli değildir. Kuruluş hangi riskin kastedildiğini, sonuçları kimin taşıdığını ve karara kimin itiraz edebileceğini açıklamalıdır. Anlaşmazlık halinde, uzlaşmazlık bir ortalamada kaybolmak yerine tutanağa girmelidir.
İşlenmiş örnek: kurgusal bir sürekli eğitim kurumu
Başlangıç durumu
Küçük bir sürekli eğitim ekibi kurs içerikleri, tarihler, katılım koşulları ve örgütsel süreçler hakkındaki genel soruları işler. Mevcut sınıflandırma tutarsızdır. Bir dil modeli olası yardımcı olarak tartışılmaktadır. Ekibin temsil edici yerel bir değerlendirmesi, belirlenmiş bir referans sınıflandırması ve kullanımın işlem süresini kısalttığına veya kaliteyi iyileştirdiğine dair kanıtı yoktur. Kısa bir öğretim simülasyonunda yapay olarak oluşturulmuş bazı örnekler makul görünür. Bu gösterim ürün performansının testi değildir: Temsil edici gerçek dağılım, sistematik hata değerlendirmesi ve sağlam bir temel çizgi içermez.
Dört kaydı doldurmak
Ampirik kanıt. Şu an kanıtlanan tek şey, sentetik sorularla sınırlı bir masa başı alıştırmasının oynanabileceğidir. Bu, roller, sınıflandırma kuralları ve olası devirler üzerine sorulara olanak tanır. Belirli bir modelin gerçek soruları nasıl sınıflandıracağını, hataların ne sıklıkta ortaya çıkacağını ya da zaman tasarrufu sağlayıp sağlamayacağını kanıtlamaz. “Yapay zekâ sürecimizi iyileştiriyor” iddiası açık kalır.
Normatif gerekçeler. Hiç kimse alışılmadık ifade biçimi, teknik terim eksikliği veya bir dil örüntüsü nedeniyle sistematik olarak daha geç yardım almamalıdır. Katılım veya erişilebilirlik üzerinde etkisi olan sorular sessizce “rutin” diye kaybolmamalıdır. Çalışanların anlaşılabilir bir müdahale olanağına ihtiyacı vardır. Adım simülasyonun ötesine geçmeden önce, etkilenenler ve olası hata sonuçları daha ayrıntılı incelenmelidir.
Kurumsal amaç. Ekip, soruları daha güvenilir işlemek ve yinelenen sınıflandırma işini azaltmak istiyor. Amaç “yapay zekâ kullanmak” değildir. Tutarsız kurallar zaten süreç sorunu olarak görünür olduğundan, standart bir manuel şablon makul ilk adım olabilir.
Risk toleransı. Sentetik vakalarla ve gerçek bir sistemi çağırmadan yapılan salt süreç alıştırması geri döndürülebilirdir. Gerçek sorularla sınıflandırma veya otomatik yanıtlar ise nitelikçe farklı adımlar olurdu. Amaç, veri akışı, inceleme ölçütü, sorumluluk, itiraz yolu ve sonlandırma ölçütü açıklığa kavuşana kadar üretken ya da dışa dönük hiçbir kullanım onaylanmaz.
“Yapay zekâ ya da durgunluk” yerine seçenekler
| Seçenek | Şimdi neyi mümkün kılar | Neyi kanıtlamaz veya çözmez | Simülasyondaki durum |
|---|---|---|---|
| A. Manuel sınıflandırma kurallarını standartlaştırmak | Görünür süreç sorununu doğrudan ele almak; sorumlulukları ve şablonları netleştirmek | Ek olarak bir yapay zekâ sisteminin fayda sağlayıp sağlamayacağını | Hemen anlamlı ve geri döndürülebilir |
| B. Sentetik masa başı alıştırması yürütmek | Devirleri, sınır vakaları, eksik ölçütleri ve sonraki inceleme için soruları görünür kılmak | Gerçek model performansı, gerçek hata oranları veya verimlilik artışı | Öğrenme ve yönetişim alıştırması olarak onaylandı |
| C. Gerçek veri pilotu veya otomatik yanıt | Daha sonra gerçeğe daha yakın bir kullanımı inceleyebilir | Amaç, veri/sözleşme durumu, ölçüm tasarımı ve gözetim netleşmeden başlatılamaz | Ertelendi; onay yok |
Dolayısıyla gerekçeli karar ne “yapay zekânın faydalı olduğu kanıtlandı” ne de “yapay zekâ asla kullanılamaz”dır. Ekip önce manuel sınıflandırmayı standartlaştırır ve sentetik bir masa başı alıştırması yapar. Burada sözde bir isabet oranını değil, açık çalışma sorularını belgelendirir: Hangi soru insan danışmanlığı gerektiriyor? Hangi kategori fazla kaba? Yanlış atamayı kim düzeltiyor? Otomasyondan bağımsız olarak hangi vakalara öncelik verilmelidir? Böyle bir masa başı alıştırması ne gerçek sistem çıktılarıyla bir test ne de sonraki doğruluğun kanıtıdır. Ancak gelecekteki bir araştırma için soruyu daha dar ve incelenebilir kılabilir.
● Yalnızca üyeler
Üyelikle tüm makaleyi oku ve tüm dosyaları indir.
Tüm makaleyi + indirmeleri aç → Abone ol0 yorum
● Yorumlar yükleniyor…