← SAKIZLI AI
Article30 Eyl 2026 · 22 dk okuma19 / 21Üyeler · Abonelik

Müdahale edebilen insan gözetimi

Küçük bir ekibin, bir kişinin gerçekten durdurabildiğini, düzeltebildiğini ve gerekçe sunabildiğini sınamak için kasten hatalı bir yapay zekâ taslağıyla çalışması

FFurkan SakızlıYZ araştırmacısı & eğitmen · bağımsız
Açık renkli kâğıt üzerinde koyu bir küreden cam disklerin üzerinden bir düğüme uzanan bir yol; önünde cam bir okun karşısında koyu mavi bir engel duruyor, dallar altın renkli bir küreye ve mavi bir diske gidiyor
Etki doğmadan önce birinin durdurabileceği bir nokta vardır
Görsel yapay zekâ ile üretildi

Bir yapay zekâ bir yanıt hazırlar. Bir kişi göndermeden önce yanıtı görür ve “Onayla”ya tıklar. Organizasyon şemasında bu durum belki “insan gözetimi” olarak görünür. Ancak gerçek işte bu tıklama neredeyse boş olabilir: Kişi belirleyici vaka bilgisini görmez, gönderimi durduramaz, araştırma yapacak zamanı yoktur, güvenilir bir yedek yol bilmez ya da belirsizliği tek başına üstlenmek zorundadır. Bu durumda süreçte bir insan vardır, fakat süreci değiştirebilecek durumda değildir.

Bu yüzden belirleyici soru şudur: Süreçte bir insan var mı? Değil; soru şudur: Bu kişi somut bir hatalı çıktıyı fark edebilir, etkisini ortaya çıkmadan durdurabilir, savunulabilir bir alternatif seçebilir ya da açıkça belirlenmiş bir mercii devreye sokabilir ve gerekçeyi sonradan izlenebilir kılabilir mi? Bu soru bir rol adıyla yanıtlanamaz. Müdahaleyi gerçekten mümkün kılan koşullar altında bir deneme gerektirir.

Bu yazı küçük bir ekip için böyle bir deneme geliştirir. Vaka, tüm roller, tüm ürünler ve tüm sonuçlar tamamen kurgusaldır. Alıştırma müşterilere hiçbir şey göndermez ve üretimdeki bir sistemin performansını ölçmez. Sonucu da bir kuruluş için kalite mührü değildir. Yalnızca, önceden belirlenmiş bir gözetim yolunun, eğitimde ya da kurum içi kuru çalışmada bilinen bir hata karşısında pratikte uygulanıp uygulanamadığını gösterir.

Sınırın çizilmesi önemlidir. “AI hazırlık yaptığında sorumluluğu kim taşır?” makalesi, sorumluluk ve hesap verebilirliğin roller arasında nasıl dağıtılacağını ele alır. “Zaman Baskısı Altında Yargıda Bulunmak” makalesi, zaman baskısı ve iş yükünün muhakemeyi nasıl değiştirebileceğini inceler. “Gölge AI ve verilerin onuru” makalesi, açıklanmamış yapay zekâ kullanımı ve veri akışlarıyla ilgilidir. Bu dizinin sonraki bir makalesi ise başlangıç düzeyi, zarar göstergeleri ve durdurma eşiği olan sınırlı bir pilotu temel alır. Burada odak daha dardır: dış etki doğmadan önce gözlemlenebilir bir gözetim denemesi. Bir insanın hatalı bir öneriyi etkili biçimde durdurabilmesi için ne bulunmalıdır?

Bir tıklama gözetim değildir

Gözetim bir karakter özelliği değildir. Bir kişi, bir karar ve teknik ve örgütsel bir yol arasındaki ilişkidir. Sembolik bir varlıktan fazlası olması için en az altı şeyin bir araya gelmesi gerekir:

1. Görünürlük: İnceleyen kişi yapay zekâ çıktısını ve çıktıyı denetlenebilir kılan bağlamı görür.

2. Bağımsız referans: Çıktıyı yalnızca makul görünüp görünmediğine bakmak yerine güncel, erişilebilir uzmanlık bilgisiyle karşılaştırabilir.

3. Yetki: Etki doğmadan önce durdurabilir, gerekçeli olarak geçersiz kılabilir ya da yetkili role iletebilir; eylem olanağı olmayan bir uyarı yeterli değildir.

4. Zaman ve dikkat: Zaman aralığı, kararın ağırlığına uygun bir incelemeye izin verir.

5. Beceri ve destek: Kişi görevi, tipik hata sınırlarını ve eskalasyon yolunu anlar ya da bunları dolambaçsız biçimde netleştirebilir.

6. Güvenli geri dönüş: Durdurmadan sonra izin verilebilir bir sonraki eylem vardır; örneğin manuel bir yanıt, bir geri soru ya da uzman incelemesi.

Bu liste yasal bir kontrol listesi ya da ampirik olarak doğrulanmış bir asgari formül değildir. Sadece, testte hangi ön koşulların eksik kalabileceğini görünür kılar. İşlevi tam da budur: Bilgi ya da yetki zinciri müdahaleyi imkânsız kılmışsa, ekip gözden kaçan bir hatadan inceleyen kişinin “yeterince iyi dikkat etmediği” sonucunu çıkarmamalıdır.

Bunun ardında basit ama talepkâr bir felsefi nokta vardır. Sorumluluk her şeyi bilme koşulunu gerektirmez. Ancak birinin fark yaratabilmesini ve eylem gerekçelerinin sonradan uydurulmak zorunda olmamasını gerektirir. Belirleyici gerekçeye erişmeden bir kararı biçimsel olarak onaylayan kişi, uygun eylem gücü olmayan bir yük taşır. Bir hatayı saptayıp gönderimi durduramayan kişi gözetim yapan değil, tanıktır. Bu nedenle adil bir tasarım yalnızca sonunda kimin imza attığını değil, belirleyici anda kimin hangi imkânlara ve hangi desteğe sahip olduğunu da sorar.

Bu bakış iki daraltmayı önler. İlki, her yükümlülüğü tek tek inceleyen kişiye yükler: Bir hata, görüntüleme, süre, erişim veya yetkilendirme kötü tasarlanmış olsa bile kişisel dikkatsizlik diye açıklanır. İkincisi, yapay zekâ sistemleri karmaşık olduğu için insanlara hiçbir rol tanımaz. Karmaşıklık insan incelemesini zorlaştırır; atanmış bir müdahalenin gerekliliğini ortadan kaldırmaz. Amaç, her çıktıyı kusursuz biçimde tanıyan bir insan değildir. Amaç, fark edilebilir belirsizlikte dış etkiye aceleyle zorlamayan bir süreçtir.

AB Yapay Zekâ Tüzüğü, yüksek riskli yapay zekâ sistemleri için özellikle somut bir ölçüt koyar: Yetkili gerçek kişilerin, koşullara göre, diğerlerinin yanı sıra bir çıktıyı doğru yorumlaması, kullanmaması, göz ardı etmesi, gerekçeli olarak geçersiz kılması ya da tersine çevirmesi ve sistemin işleyişine müdahale etmesi veya onu kesintiye uğratması mümkün olmalıdır. Bu tür sistemlerin işletmecileri, gözetimi gerekli yeterlilik, eğitim, yetki ve desteğe sahip kişilere devretmelidir.1 Bu kural her yapay zekâ asistanı ve her küçük işletme için genel olarak geçerli değildir. Somut bir sistemin bu uygulama alanına girip girmediği, rolüne, kullanımına ve risk sınıflandırmasına bağlıdır.

Kısa hukuk kutusu, 29 Eylül 2026 itibarıyla: Aşağıdaki vaka kartları, kurgusal metin asistanının yüksek riskli yapay zekâ olduğunu ileri sürmez. Birleştirilmiş metne göre Bölüm III’ün 2 ve 3. kısımlarındaki ilgili gereklilikler, Ek III ile bağlantılı Madde 6(2) kapsamındaki sistemler için 2 Aralık 2027’den itibaren; Ek I ile bağlantılı Madde 6(1) kapsamındaki sistemler için ise 2 Ağustos 2028’den itibaren geçerlidir. Bu yüzden gerçek vakalarda Değişiklik Tüzüğü (AB) 2026/1744 ile birleştirilmiş metin inceleme materyalinin parçasıdır. Somut bir hukuk sorusu ayrıca sistemi, rolü, hukuk alanını, tarihi, sözleşmeyi ve olguları gerektirir.1,2

Bu hukuk çerçevesinin dışında da düşünce yararlıdır: Bir kuruluş, simüle edilmiş bir hata üzerinden kendi denetlenebilir onay iddiasının teknik ve örgütsel olarak yerine getirilip getirilmediğini sınayabilir. Bu, hukuki yükümlülük ya da etkililik hakkında bir ifade değil, bir tasarım kararıdır.

Araştırmanın işaret ettikleri ve etmedikleri

Üç özgün çalışma, gözetimi bir açıklama düğmesine indirgememek için neden sunar. Her biri sınırlı deneysel görevleri ele alır; gerçek yedek parça kararlarını değil. Tam da bu nedenle bunlardan genel bir başarı vaadi çıkarılamaz.

Bilişsel zorlayıcı işlevler üzerine bir çalışma, yemek görsellerinden daha düşük karbonhidratlı bir malzeme seçerken 199 çevrimiçi katılımcıyı inceledi. Simüle edilmiş yapay zekâ vakaların dörtte birinde kasten yanlıştı. Diğerlerinin yanında basit açıklamalar, kişinin önce kendi düşünmesini ya da gerekçe sunmasını isteyen akışlarla karşılaştırıldı. Hatalı önerilerde, bu tür müdahalelerin bulunduğu koşullarda öneriler daha sık benimsenmedi; aynı zamanda bu koşullara duyulan güven ve tercih daha düşüktü.4 Bu, işletimde öne konan her sorunun hataları önlediğinin kanıtı değildir. Ancak “öneriyi hemen göster, sonra onay iste” düzeninin tarafsız bir tasarım sayılmaması gerektiğini gösterir.

Toplam 3.800 katılımcılı bir başka deneysel çalışma, basitleştirilmiş bir konut fiyatı tahmini kullandı. Şeffaf biçimde gösterilen doğrusal bir model daha kolay anlaşılabiliyordu, fakat otomatik olarak daha uygun düzeltmeye yol açmadı. Alışılmadık veri noktalarındaki büyük hatalarda, katılımcılar açık model koşulunda hataları daha kötü fark etti ve düzeltti.5 Yazarlar olası açıklama olarak aşırı yükü tartışır. Bulgular her görselleştirme veya uzmanlık alanına kendiliğinden uygulanmaz. Yine de pratik bir ihtiyata çağırır: Daha fazla gösterilen bilgi, daha fazla müdahale kapasitesiyle aynı şey değildir.

Üçüncü bir çevrimiçi çalışma 600 katılımcıya kısa biyografileri sınıflandırttı. İncelenen açıklama koşullarının hiçbiri, hatalı önerilerin doğru önerilere kıyasla seçici biçimde daha sık gerekçeli olarak geçersiz kılınmasına yol açmadı. Buna rağmen belirli açıklamalar override davranışını değiştirdi; bu, seçici olarak doğru bir düzeltme yaratmadı.6 Ekrandaki bir gerekçe böylece insanları etkileyebilir, fakat bu görevde hata aramalarını güvenilir biçimde iyileştirmeyebilir.

Ortak sonuç sınırlıdır: Görünür öneriler ve görünür açıklamalar etkili insan gözetiminin kanıtı olarak yeterli değildir. Bir testi tasarlarken, kişiye önce vaka dosyasını inceletmek, sonra yapay zekâ çıktısını bağımsız bir referansla karşılaştırmak ve gerçek durdurma veya yetkili role iletme yolunu gözlemlemek makuldür. Bu sıra, sınırlı kanıt ve pratik ihtiyattan doğan bir öneridir; sınanmış evrensel bir kural değildir.

Gönüllü NIST Yapay Zekâ Risk Yönetimi Çerçevesi bu ölçülülüğe uyar. Her kullanım için belirli bir durdurma düğmesi istemez. Bununla birlikte insan-yapay zekâ yapılandırmaları için roller ve sorumlulukları, belgelendirilmiş gözetim süreçlerini ve geri bildirim, şikâyet, override, hizmet dışı bırakma ve değişiklik yönetimi prosedürlerini açıklar.3 Çerçeve aynı zamanda insanların yapay zekâ çıktılarına gerçekten itiraz edebilecek durumda ve istekli olup olmadığının araştırılması gerektiğine işaret eder. Bu, yalnızca bir politika yayımlamak yerine, müdahale yolunu hatalı bir çıktıyla çalışmak için iyi bir gerekçedir.

Şema: solda bir nokta ve ok bulunan bir kart, ortada merkezî bir düğüm taşıyan yüksek cam bir sütun; oradan kesikli bir yol bir çarpıya, altın renkli bir yay yukarı oklu bir noktaya, mavi bir çizgi ise bir artı işaretinin üzerinden sağa uzanıyor; noktalı bir yay artıdan ilk karta geri dönüyor
Durdurmak, üst makama taşımak veya gerekçeyle değiştirmek – ve sonuç kurala geri akar
Görsel yapay zekâ ile üretildi

Tamamen kurgusal A21/A12 vakası

Nordwerk Ersatzteile işletmesi kurgusaldır. Gerçek ürün satmaz ve gerçek müşterisi yoktur. Ekip bu alıştırmada onaylanmış bir metin asistanını yalnızca yalıtılmış bir test ortamında kullanır. Asistan bir yanıt taslağı oluşturabilir, fakat ne mesaj gönderebilir ne de stok değiştirebilir.

F-217 kimlikli kurgusal vaka dosyası şu talebi içerir: “Lütfen bir bakım için A21 parça tipinin kullanılabilirliğini onaylayın.” Alıştırmanın iç referans kartı, A21’i istenen parça tipi olarak belirtir ve bu kurgusal test vakası için “kullanılabilir” durumunu kaydeder. Buna karşılık kasıtlı olarak hatalı yapay zekâ taslağı şöyle yanıtlar: “A12 parça tipi kullanılabilir ve rezerve edilecektir.” A21 ve A12 tamamen uydurulmuş karakter dizileridir. Fark bilerek küçüktür; böylece deneme yalnızca kaba bir saçmalığı değil, dikkat, kaynak ve müdahale hakkı arasındaki bağlantıyı sınar.

Hatalı çıktı, yapay zekâyı teşhir etmek veya inceleyen kişiyi sınavdaki gibi test etmek için yoktur. Tanıma ile eylem arasındaki yolu sınar. Bu nedenle başlamadan önce dört koşul belirlenir:

ÖğeAlıştırmadaki düzenleme
İnceleme temeliF-217 vaka dosyası ile parça tipi ve kurgusal kullanılabilirlik durumunu içeren referans kartı taslağın yanında bulunur; web araması veya model bilgisi gerekmez.
Etki kilidiSimülasyonda gönder düğmesi, inceleyen kişi “Onay” durumunu verene kadar kilitlidir.
Müdahale yolları“Durdur” taslağı bekletir. “Override”, taslağı kaynağa dayalı manuel bir yanıtla değiştirir. “Eskalasyon”, uzman rol için bir netleştirme görevi oluşturur.
Geri dönüşReferans yoksa veya çelişkiliyse kullanılabilirlik ileri sürülmez; güvenli metin şudur: “Kullanılabilirliği netleştirip size geri döneceğiz.”

Alıştırma, gündelik hayatta kolayca birbirine karışan üç kararı ayırır. Durdurma şunu ifade eder: Somut taslak etki doğurmamalıdır. Override şunu ifade eder: Gözetim yapan rol, taslağı gerekçeli olarak başka bir yanıtla değiştirmek için yeterli referansa ve yetkiye sahiptir. Eskalasyon şunu ifade eder: Referans veya uzmanlık yeterli değildir; sonraki eylem sınırlı bir netleştirme görevidir. Eskalasyon bir başarısızlık değildir. Güvenli bir ikame yoksa doğru karardır.

Bu ayrım yaygın bir yanlış anlamaya karşı da korur: Gözetim, her kişinin her hatayı kendisinin çözmesini gerektirmez. Kişinin, ne zaman kararı güvenle veremeyeceğini fark etmesini ve işlemi dış etki olmadan yetkili bir incelemeye devretmesini gerektirir.

Kurgusal gözetim denemesinin örnek yürütülüşü

Aşağıda kurgusal eğitim simülasyonunun tamamen yürütülmüş bir örnek çalışması yer alır. Süreler uydurulmuş didaktik çalışma kâğıdı verileridir; işletmeden alınmış ölçüm değerleri, kişisel performans verileri veya insanlar arası karşılaştırmalar değildir. “İnceleme kişisi” rolü kurgusal bir roldür; hiçbir gerçek kişi katılmamıştır.

Denemeden önce inceleme kişisi kısa gözetim kartını aldı; fakat hangi kartta hata yerleştirildiğine dair ipucu almadı. Moderatör, durdurma, override ve eskalasyonun test arayüzünde erişilebilir olmasını sağladı. Deneme üç ayrı karttan oluştu:

KartGörünür durumBeklenen eylemGerçekte belgelenen eylemSimülasyon sonucu
1: Hata kartıTalep A21; referans kartı A21 kullanılabilir; taslak A12 vaat ediyorÇelişkiyi fark etmek, gönderimi durdurmak, A21 metnini override olarak yazmak1 dakika 42 saniye sonra: A21/A12 işaretlendi; “Durdur” seçildi; referans kartına atıf içeren manuel yanıt taslağı hazırlandıBeklenen eyleme ulaşıldı; hatalı etki kilitli kaldı
2: Eksik kartıTalep A21; referans kartı yok; taslak A21 kullanılabilir diyorTahmin etmemek; durdurmak ve uzman role eskale etmek58 saniye sonra: “Durdur” seçildi; eksik referansla netleştirme görevi belgelendi; ikame bir vaat verilmediBeklenen eyleme ulaşıldı; sahte kesinlik üretilmedi
3: Karşı kartTalep A21; referans kartı A21 kullanılabilir; taslak ek iddia olmadan A21’i onaylıyorReferansı karşılaştırmak ve gerekçeli olarak onaylamak1 dakika 16 saniye sonra: Karşılaştırma belgelendi; simülasyon için onay verildiTutarlı taslak refleksle engellenmedi

Protokol yalnızca planlanan yolun bu kontrollü alıştırmada kullanılabildiğini gösterir. Şunu göstermez: Kişinin iş baskısı altında da aynı şekilde davranacağını, asistanın başka vakalarda güvenilir biçimde fark edilebilir hatalar yapacağını veya kuruluşun bununla riskleri azalttığını. Süreler, sonraki düşünme için kullanılır: Senaryoda inceleme süresi yeterli miydi? Referans kolay bulundu mu? Durdurma anlamlı bir sonraki eylem üretti mi? Bunlar üretimde hedef süre için bir gösterge değildir.

En önemli gözlem 2. karttadır. Salt hata tanıma orada yetersiz kalır. Taslakta görünür bir A21/A12 karışıklığı yoktur, fakat kullanılabilirlik ifadesinin temeli eksiktir. İnceleme kişisi hızla düzeltmeye zorlanmış olsaydı belki bir iddia uyduracaktı. Bu alıştırmada gözetim, belirsizliği fark etmek ve kararı sınırlamakla gerçekleşir. Bu, sorumlu denetimi her zaman anında bir yanıt vermek zorunda olma beklentisinden ayırır.

Her karttan sonra kısa bir iz kaydedilir:

Hangi referans vardı veya eksikti? Hangi somut çelişki, belirsizlik ya da doğrulama görüldü? Hangi etki henüz ortaya çıkmamıştı? Durduruldu mu, override yapıldı mı, eskale mi edildi, yoksa onay mı verildi — neden? Öngörülen yol teknik ve örgütsel olarak erişilebilir miydi? Hangi kalan belirsizlik sürüyor ve onu sırada kim ele alıyor?

Tam bir iz, yalnızca öz belgelendirmeye dönüşmemelidir. Amacı tasarımı gözden geçirmektir. Örneğin durdurma yalnızca erişilemeyen bir yönetici rolü aracılığıyla çalışsaydı, test “zar zor geçilmiş” sayılmazdı; gözetim yolu yetersiz olurdu. İnceleme kişisi A21 ile A12’yi fark edip referans kartını bulamasaydı, bu yalnızca bir dikkat sorunu sayılmazdı. Vaka tasarımı o zaman bilgi erişimini, gösterimi veya sorumluluğu değiştirmelidir.

K’yı uygulamak: dört aşamalı temel döngü

K danışma modeli burada gerekçeli bir gözetim yolu için yapı sunar. Temel döngüsünde dört adım vardır: keşif, düşünme/analiz, karar/öneri ve geri bildirim/değerlendirme. Bu, denemenin etkili olduğuna dair kanıt değildir. Bir kararı taslağın yüzeyine indirgememeye yardım eder.

1. Keşif: İnsan kontrolünde ne kalmalıdır?

Nordwerk Ersatzteile önce şunu belirler: Asistan yalnızca metin taslakları üretir. Kullanılabilirlik iddiası, ancak bir kişi simülasyonda onaylarsa etkili olur. Kurgusal vakada etkilenenler talepte bulunan kişi, uzman rol, yanıtı işleyen rol ve yanlış söz vermemesi gereken işletmedir. Alıştırma ayrıca gerçek müdahale noktalarını kaydeder: Taslağı bekletmek, metni değiştirmek, uzman sorusu açmak ve daha sonra kuralı değiştirmek.

Keşif, aracın “iyi” olup olmadığını sormaz. Hangi kararın hazırlandığını, bu kararı hangi referansın taşıdığını ve bir hatanın nerede sonuç doğuracağını sorar. A21/A12 vakasında denetlenebilir referans vaka kartıdır. Gerçek bir vakada onaylanmış bir uzmanlık kaynağı olabilir; bu kaynak erişilebilir değilse süreç görünürde bir inceleme istememelidir.

2. Düşünme ve analiz: Hızlı taslakta hangi çatışma vardır?

Hızlı yanıtlar talepte bulunan kişi için yararlı olabilir. Fakat güvence altına alınmamış bir söz, bakım, planlama ve güveni etkileyebilir. Her iki taraf da ciddiye alınmalıdır. Bu nedenle ekip yalnızca “yanlış parça adı” diye yazmaz; aynı zamanda şunları sorar: Kimse müdahale etmezse ne olur? Gerçek zaman aralığı ne kadar? İnceleyen rolün hangi bilgiye ihtiyacı vardır? Ne zaman geri soru, akıcı fakat gerekçesiz bir yanıttan daha adildir?

● Yalnızca üyeler

Üyelikle tüm makaleyi oku ve tüm dosyaları indir.

Tüm makaleyi + indirmeleri aç → Abone ol

0 yorum

● Yorumlar yükleniyor…

Yorum yapmak için giriş yapın · üye olun →