Sınırlı pilot
Küçük bir ekip yapay zekâyı deneme amaçlı nasıl kullanır, yapay zekâsız bir temel ile karşılaştırır ve olumsuz bir bulguda gerçekten nasıl durur

Bir yapay zekâ önerisi günlük işte çok hızlı biçimde alışkanlığa dönüşebilir. Önce, “Yalnızca bir kez, işe yarayıp yaramadığına bakalım,” denir. Birkaç hafta sonra eski çalışma biçimi artık uygulanmıyordur, araç şablonlara yerleştirilmiştir ve denemeyi kimin sonlandıracağı artık hiç kimse için açık değildir. Bu, sonucu açık olan küçük bir devreye alma değil, açık bir kararı olmayan bir devreye almadır.
Sınırlı bir pilot daha erken başlar. Somut çalışma biçimleri arasındaki süreli bir karşılaştırmadır. Başlamadan önce ekip neyi deneyeceğini, neyi denemeyeceğini, yapay zekâ olmadan hangi işin mümkün kalacağını, neyi fayda olarak sayacağını, hangi hata veya yüklerin anlamlı olduğunu ve hangi bulgunun duraklatmaya yol açacağını belirler. Sonunda bir başarı hikâyesi değil, gerekçeli bir karar bulunur: bitirmek, daha dar biçimde yeniden kurmak, uzmanlık sorusunu açıklığa kavuşturmak veya sıkı belirlenmiş koşullarda incelemeye devam etmek.
Bu makale bunun için tamamen kurgusal bir vaka geliştirir. “Nordwerk” gerçek bir şirket değildir. Vakada kişi, müşteri, çalışan veya sözleşme verisi yoktur. Konu yalnızca kurum içinde dört işlem yolundan birine atanan yapay talep kartlarıdır. Dış temas, gönderim, stok ya da müşteri sistemlerine erişim yoktur. Tam da bu sınır, vakayı bir ders veya küçük ekip için kullanılabilir kılar: Grup, üretken bir süreci alıştırma alanı olarak kullanmadan karar tasarımı üzerinde çalışabilir.
Temel soru şudur: Küçük bir ekip yapay zekâ kullanımını; fayda, ek iş, hata ve zararların yapay zekâsız bir temel ile karşılaştırılacağı ve olumsuz sonucun gerçekten durmaya yol açacağı şekilde nasıl süreli olarak deneyebilir?
Yanıt bilinçli olarak mütevazıdır. Sekiz haftalık bir pilot, sınanan kartlar, roller ve koşullar için ipuçları verir. Ne genel etkinliği ne güvenliği, etik uygunluğu ya da hukuka uygunluğu kanıtlar. İyi bir ortalama sayı anlamlı tekil hataları gizleyebilir. Bu nedenle pilot, genel bilançonun yanında hata sınıflarına, zor vakaların ayrı değerlendirilmesine, erişilebilir bir geri dönüş yoluna ve önceden kararlaştırılmış sert bir durdurma eşiğine ihtiyaç duyar.
“Yapay zekâ iyi mi?” değil, “Burada hangi iş kararı savunulabilir?”
Örnekte Nordwerk, yedek parça taleplerini önce iç kısa not olarak işler. Her yapay talep kartı için ilk bir sınıflandırma gerekir. Dört yol seçeneği vardır:
1. Standart vaka: Kart açık bir referans içerir; işlemi yürüten kişi normal iç kontrol rutinini başlatabilir.
2. Eksik referans: Esas bilgiler eksiktir; kart açıklığa kavuşturulmak üzere beklemeye alınır.
3. Uzman incelemesi: Bilgiler vardır; ancak sınıflandırma uzmanlık bilgisi veya çelişkili bir referans gerektirir.
4. Durdur/istisna: Kart bir çelişki, öngörülmeyen bir kategori veya testte işlenmemesi gereken bir işaret içerir.
Ekip yalnızca bu dört yoldan birini öneren bir yapay zekâ asistanını değerlendirir. Yapay zekâ hiçbir şeyi tetikleyemez. Bir kişi öneriyi test tablosunda kabul eder veya reddeder. Kartlar, referans çözüm ve ölçütler yapay olarak hazırlanmıştır. Böylece belirleyici soru açık kalır: Öneri, sınırlı iş kesitinde hataları, ek işi veya eşit olmayan dağıtılmış kontrol yükünü artırmadan toplam işi azaltıyor mu?
Bu ifade bu makaleyi tekil bir denetim örneğinden ayırır. Bir denetim örneği, bir kişinin bilinen hatalı çıktıda gerçekten durup duramayacağını, müdahale edip edemeyeceğini veya durumu yükseltebilip yükseltemeyeceğini gösterebilir. Bu önemlidir, ancak henüz pilot değildir. Pilot ek olarak karşılaştırmayı, süreyi, vaka karışımını, birkaç hafta boyunca harcanan emeği ve nihai kararı sorar. Denetim yeteneği burada gölge kol için bir önkoşul kabul edilir; yeniden tekil test olarak yürütülmez.
Tek başına bir kullanım vakası kartı da yeterli değildir. Amaç, veri bölgesi, roller ve durdurma imkânlarını kayda geçirebilir. Bu makale bu ön çalışmayı kullanır; ancak doğrulanabilir bir deney mantığı ekler: yapay zekâ olmadan elle yürütülen başlangıç durumu, yapay zekâ olmadan yapılandırılmış bir kural kartı, bir yapay zekâ gölge kolu, bağımsız olarak belirlenmiş referans ve iki yolun nasıl değerlendirileceğine ilişkin kurallar.
Bu, her teknik yardıma duyulan bir güvensizlik değildir. Sorumluluğun kime atfedildiği sorusudur. Yeni aracın faydasını iddia eden kişi, onunla birlikte yeni ortaya çıkan işi de görmelidir: girdileri hazırlamak, önerileri denetlemek, referans aramak, hataları düzeltmek, özel durumları ele almak ve durdurma halinde süreci yapay zekâsız temele geri döndürmek. Bu iş sayılmadığı için görünmez olursa görünürde bir zaman tasarrufu doğar.
Hızlı bir ortalama sayı neden yeterli değildir
Felsefi olarak mesele ölçüm yönteminden fazlasıdır. Pilot zaman, dikkat ve riski dağıtır. Yönetim daha hızlı tamamlanan işlemlerden memnun kalırken denetleyen kişi ek kontrol işini üstlenebilir. Sık görülen ve kolayca düzeltilebilen bir öneri ortalama süreyi azaltabilir, ama aynı anda nadir vakaları yanlış yola gönderebilir. Bu durumda yalnızca ortalama bildiren kişi, farklı sonuçları birbirinin yerine geçebilirmiş gibi ele alır.
Savunulabilir bir karar bu farklılıkları tek bir ahlaki sayıya sıkıştırmak zorunda değildir. Ancak hangi değerlerin gerilim içinde olduğunu açıkça göstermelidir: çalışma süresi, güvenilirlik, itiraz imkânı, uzmanlık titizliği ve şüphe durumunda yükü kimin taşıdığı. Geri döndürülebilirlik burada pratik bir değerdir. Ekip, değişim için yeterli neden oluşmadan manuel çalışma biçimini ortadan kaldırmaz. Bu nedenle durdurma, pilotu hazırlayan kişiler için kişisel başarısızlık değildir. Öngörülen kararlardan biridir.
Buna rağmen en güçlü karşı görüş şudur: Küçük bir ekip ayrıntılı bir karşılaştırmayı karşılayamaz. Dokümantasyon zaman alır. Az sayıdaki kartta vaka karışımı, öğrenme etkileri ve rastlantılar bulguyu şekillendirebilir. Gölge işletim çift iş gerektirir. Bir ekip önce sekiz hafta ölçüm yaparken diğerleri çoktan daha hızlı çalışıyorsa ihtiyatın kendisi zarar yaratabilir.
Bu itiraz güçlüdür. Tablo ritüeline karşı çıkar, her sınırlı teste karşı değil. Uygun yanıt gittikçe büyüyen bir kontrol sistemi değildir. Şudur: Somut karar için gerektiği kadar ölçmek; ölçümü önceden açıklamak; gerçek bir yapay zekâsız seçeneği korumak; sonucu da sınırlı tutmak. Pilotun emeği daha başlamadan olası faydasından yüksekse karar “pilot yok” olabilir. Kısa ve dar kapsamlı bir karşılaştırma, daha iyi bir kural kartının, daha açık bir referansın veya ek öğrenme zamanının yapay zekâdan daha çok yarar sağladığını da gösterebilir.
Kaynaklar bir pilot için neyi önerir ve neyi belirlemez
NIST Yapay Zekâ Risk Yönetimi Çerçevesi gönüllü bir çerçevedir, hukuk normu değildir. Sekiz haftalık süre, asgari vaka sayısı veya genel bir durdurma düğmesi istemez. Bununla birlikte kullanım bağlamını ve risk toleranslarını belgelendirmeyi, ölçütleri ve test koşullarını kayda geçirmeyi, aktarılabilirlik sınırlarını görünür kılmayı ve risk ele alınırken kullanılabilir yapay zekâsız alternatifleri dikkate almayı önerir.1 Nordwerk için bundan NIST yükümlülüğü değil, bir çalışma kuralı çıkar: Karşılaştırma, yapay zekâ çıktısının makul görünüp görünmediği sorusundan ibaret olmamalı; gerçek bir manuel alternatif içermelidir.
Tek bir toplam sayının neden yeterli olmadığını, hemşirelik eğitimi ve klinik simülasyondaki özgün bir çalışma gösterir. Çalışmada 450 hemşirelik öğrencisi ve 12 kayıtlı hemşire, yapay zekâ önerisiyle ve önerisiz tarihsel vakaları değerlendirdi. Yapay zekâ desteği, ilgili algoritmanın özellikle doğru veya özellikle yanıltıcı olmasına göre ortak insan-yapay zekâ performansını iyileştirebildi veya kötüleştirebildi. Yazarlar, temsili olarak ağırlıklandırılmış ya da ortalaması alınmış bir değerlendirmenin sık küçük faydaları daha seyrek büyük zararlarla dengeleyebileceği ve böylece ağır sonuçları gizleyebileceği uyarısında bulunur.2 Bu, yedek parça işletmesinde yapılmış bir ölçüm değildir. Ancak zor ve hataya açık kartları ortalama değerin içinde kaybetmek yerine ayrı değerlendirme yönündeki ihtiyatlı tasarım fikrini destekler.
İkinci bir özgün çalışma, kişi başına altı simüle sepsis senaryosunda 38 yoğun bakım hekimini gözlemledi. Hekimler kendi doz kararlarından sonra güvenli ya da kasten güvenli olmayan bir yapay zekâ önerisi gördüler ve yeniden karar verdiler. Güvenli olmayan öneriler güvenli olanlardan daha sık durduruldu, ancak istisnasız biçimde değil; istenen ikinci görüşler de hesaba katıldığında durdurulan veya yükseltilen güvenli olmayan önerilerin oranı daha yüksekti; bu fark istatistiksel olarak güvence altına alınmamıştı. Ayrıca hekimler yapay zekâ önerilerinden sonra 228 denemenin 105’inde kararlarını değiştirdi.3 Bu sayılar Nordwerk için hedef değer değildir. Aktarılabilir düşünce daha dardır: Pilot içinde yalnızca sonuç değil, öneriden sonra yapılan değişiklikler, geçersiz kılmalar, yükseltmeler ve müdahale edilmeyen durumlar da gözlemlenebilir süreç bulgularıdır.
Üçüncü bir çalışma, toplam 3.800 katılımcıyla konut fiyatı tahmini üzerine önceden kaydedilmiş çevrimiçi deneylerde, anlaşılır biçimde sunulan doğrusal modelleri daha az şeffaf modellerle karşılaştırdı. Kolay takip edilebilen model, tahminlerini zihinsel olarak izlemeye yardımcı oldu. Ancak önerileri uygun biçimde izlemeyi iyileştirmedi; alışılmadık veri noktalarındaki büyük hatalarda katılımcılar hataları daha kötü fark edip düzelttiler.4 Bu da işletmesel talep sınıflandırmasının testi değildir. Fakat kolay bir sonucu engeller: Açıklama, gösterge panosu veya onay tıklaması kalite ölçümü değildir. Pilot, sorunlu önerilerin bağımsız referansa göre fark edilip doğru işlenip işlenmediğini sınamalıdır.
AB Yapay Zekâ Tüzüğü burada yalnızca daha dar bir anlamda yer alır. Yüksek riskli yapay zekâ için tüzük, sağlayıcılardan sürekli ve yinelemeli risk yönetimi ister; ayrıca piyasaya arz sonrasında gözleme ilişkin hükümler içerir. İşletmeciler belirtilen koşullardaki riskte bilgi vermeli ve kullanımı askıya almalıdır. Ek III kapsamındaki yüksek riskli yapay zekâ için ilgili yükümlülükler, burada kullanılan zaman durumuna göre 2 Aralık 2027’den itibaren; Ek I kapsamındaki belirli sistemler için ise 2 Ağustos 2028’den itibaren geçerlidir.5 Bundan her KOBİ için genel bir pilot yükümlülüğü veya yasal sekiz hafta kuralı çıkmaz. Bu kuralların gerçek bir vakada uygulanıp uygulanmayacağı sistem, rol, kullanım amacı, risk sınıflandırması ve tarihe bağlıdır. Bu nedenle Nordwerk bir uyumluluk iddiasında bulunmaz.

Sekiz haftalık Nordwerk pilotu
Vaka üç karşılaştırma kolu kullanır. Bunlar birden çok yapay zekâ ürününü birbiriyle yarıştırma denemesi değildir. Farklı çalışma biçimlerini görünür kılar.
| Kol | Çalışma biçimi | Karşılaştırmadaki amaç |
|---|---|---|
| M: manuel başlangıç durumu | Bir kişi kartı ve erişilebilir çalışma bilgilerini okur, karar desteği olmadan sınıflandırır. | Normal kontrolü de içeren önceki temeli gösterir. |
| R: yapay zekâsız kural kartı | Yapılandırılmış kart sabit sorulardan geçirir: Referans var mı? Çelişki var mı? Uzmanlık özelliği var mı? İstisna mı? | Süreç açıklığının faydayı yapay zekâ olmadan zaten sağlayıp sağlamadığını sınar. |
| K: yapay zekâ gölge kolu | Yapay zekâ bir yol önerir. Bir kişi aynı çalışma bilgilerine göre öneriyi denetler, kabulü, düzeltmeyi veya durdurmayı belgelendirir. | İnsan-yapay zekâ yapılandırmasının fayda ve risklerini sınar. |
Üç kolun tümü aynı görev türünden yapay kartlar kullanır. Yapay zekâ gölgede kalır: Çıktısı test tablosu dışında bir sonraki süreci başlatmaz. Böylece, gerçek bir işlem yanlış yönlendirilmeden, kasten zor kartlar da sınanabilir.
Başlamadan önce bunun için görevlendirilen kişi 240 kart oluşturur. Her kart, tüm kolların aynı kapsamda erişebileceği çalışma bilgilerini içerir: örneğin bir ürün bilgisi veya bunun açıkça eksik olan referansı. Bundan ayrı olarak referans rolü, doğru dört yoldan birini gizli çözüm anahtarı olarak belirler. İşlem rolü anahtarı ancak sınıflandırmasını tamamladıktan sonra görür; yoksa deney çözümü okumayı ölçerdi. Referans rolü, kartları işleme sırasında yeniden ifade edemez. 144 kart standart vakadır, 48’inde çalışma referansları eksiktir, 24’ü uzman incelemesi ister ve 24’ü durdur/istisna kartıdır. Bu vaka karışımı kurgusal bir ders kararıdır; gerçek talep sıklıkları hakkında bir ifade değildir. Her hafta her kol 10 yeni kart alır: altı standart vaka, eksik referanslı iki kart, bir uzman incelemesi ve bir istisna. Başlamadan önce kartlar, her sınıf içinde önceden tanımlanmış zorluğa göre ayrıca tabakalandırılır ve rastgele M, R ve K’ye dağıtılır. Sınıflar ve zorluk seviyeleri her hafta eşit temsil edilir; aynı kart sürümleri iki kola gitmez. Sekiz haftada her kol için en fazla 80 kart, toplamda en fazla 240 işlem öngörülür. Bir hafta içindeki sıra da rastgele belirlenir. Atama açık farklılıkları azaltır, ancak bu küçük ve yapay miktarda tüm yanlılıkları ortadan kaldırmaz.
Gizli çözüm anahtarının eğitimi ve sabitlenmesi birinci haftadan önce yapılır. Birinci ila yedinci haftalarda, her kol için onar kartla kararlaştırılan karşılaştırma yürür; sekizinci hafta her kol için son on kartı, geri bildirimi ve nihai değerlendirmeyi içerir. K daha önce duraklatılırsa üç kolun tamamı için karşılaştırma biter. O ana kadar paralel tamamlanmış haftalar ortak değerlendirme penceresini oluşturur; kalan yapay kartlar işlenmez. Gerçek iş günlük yaşamda önce güvence altına alınmış manuel yol M’ye dönerdi. Prompt, kural kartı, roller ya da çözüm anahtarı devam eden turda sessizce değiştirilemez. Gerçek bir değişiklik ihtiyacı ortaya çıkarsa K duraklatılır ve değişiklik yeni soru olarak kaydedilir. Daha sonraki, açıkça ayrılmış bir tur yeni bir sürümü sınayabilir.
Roller küçük tutulur:
Pilot sorumlusu: tarihleri planlar, işleme için zamanı korur ve nihai karar toplantısını çağırır.
Referans sorumlusu: gizli çözüm anahtarını önceden oluşturur ve değerlendirme sırasında yalnızca gerekçeli düzeltmeleri onaylar.
Denetim rolü: kartları işler; her yapay zekâ önerisini reddedebilir veya K kolunu duraklatabilir.
Kayıt sorumlusu: ham metinler veya kişisel bilgiler toplamadan süreleri ve hata sınıflarını sayar.
Geri dönüş rolü: duraklatma halinde manuel yol M’ye geçiş yapar ve K kolunun artık kullanılmadığını belgeler.
Küçük bir ekipte bir kişi birden fazla rol üstlenebilir. Ancak gizli çözüm anahtarı ile devam eden işleme aynı elde ve aynı anda görünür olmamalıdır. Tüm kollarca kullanılabilecek çalışma bilgileri bundan ayrıdır. Amaç klinik araştırmadaki gibi biçimsel bağımsızlık değildir. Amaç, yapay zekâ önerisini görmüş kişinin doğru sınıflandırmayı buna uyacak biçimde uydurmaması veya okumamasıdır.
Neyin sayılacağını önceden belirlemek
Merkez ölçüt, tamamlanmış kart başına toplam çalışma süresidir. Kartın açılmasıyla başlar; sınıflandırma, denetim, düzeltme, kayıt girişi ve gerekli ek iş tamamlanana kadar bitmez. Bir referans eksikse ve “eksik referans” yolu doğru seçilmişse bu kararın süresi buna dahildir. Yalnızca yapay zekâ önerisine kadar geçen saniyeleri saymak ve başka kişinin denetimini paydadan çıkarmak yanıltıcı olur.
Her kol için basit kayıt şöyledir: Toplam süre = ilk işleme + denetim + düzeltme + kayıt + ek iş. K’nin R’ye göre göreli zaman kazancı (ortalama toplam süre R − ortalama toplam süre K) / ortalama toplam süre R olarak hesaplanır. Negatif sayı tasarruf yerine ek süre anlamına gelir.
“Kazanç” işareti yalnızca ölçüm değerinin tanımıdır. Karar kuralı değildir. Hızlı bir K kolu yine de başarısız olabilir.
Bu amaçla kartlar ayrıca hata sınıflarına göre sayılır. Kategoriler ilk karttan önce sabitlenir:
| Hata sınıfı | Nordwerk vakasındaki tanım | Pilottaki sonuç |
|---|---|---|
| F1: tamamlanmadan önce düzeltilen sapma | M, R veya K’de başlangıçta yanlış yol ortaya çıkar; işleme rolü bunu tamamlamadan önce düzeltir. | Düzeltme süresi her kolda sayılır; henüz nihai kalite hatası değildir. |
| F2: kayıtta yanlış yol tamamlandı | Test kartı, referansa aykırı biçimde tamamlanmış olarak belgelenir. | Kalite hatası; referans sorumlusu sebebi inceler. |
| F3: bir istisnanın kabul edilemez biçimde işlenmeye devam edilmesi | Bir durdur/istisna kartı, durdurma yerine normal veya uzmanlık sınıflandırması alır. | Sert güvenlik ihlali; derhal duraklatma. |
| F4: eksik referansın yanlış ele alınması | Referans eksik olmasına rağmen gerekçeli bir sınıflandırma ileri sürülür. | Sert kalite ihlali; derhal duraklatma. |
| F5: kontrol yükü | K’de ayrı kaydedilen denetim süresi, aynı haftadaki on K kartının en az üçünde kart başına beş dakikayı aşar veya aynı haftanın iki K kartı için önceden ayrılmış denetim süresi yoktur. | Haftalık gözden geçirmede duraklatma; korunmuş denetim süresi olmadan genişleme yoktur. |
Bir kayıt ayrıca K önerisinin kabul edilip edilmediğini, düzeltilip düzeltilmediğini, yok sayılıp sayılmadığını veya yükseltilip yükseltilmediğini de kaydedebilir. Bu K’ye özgü bir tanıdır, M, R ve K arasında karşılaştırılabilir hata sınıfı değildir. Çok sayıda kabul ne kaliteyi ne de güveni kanıtlar; önerilerin neredeyse hiç denetlenmediğini de gösterebilir. Çok sayıda düzeltme, sistemin sınırlarına ilişkin yararlı işaret olabilir ya da yalnızca ek iş anlamına gelebilir. Bunlar ancak gizli çözüm anahtarı, süre ve hata sonucuyla sonradan karşılaştırıldığında anlam kazanır. F3 ve F4, yanlış tamamlanmış yolun ağır alt vakalarıdır; toplam hata sayısına F2’ye eklenmezler.
● Yalnızca üyeler
Üyelikle tüm makaleyi oku ve tüm dosyaları indir.
Tüm makaleyi + indirmeleri aç → Abone ol0 yorum
● Yorumlar yükleniyor…