ChatGPT gibi üretken yapay zekâ uygulamaları artık günlük yaşamlarımızın ayrılmaz bir parçasına dönüştü. Büyük Dil Modelleri (LLM’ler) kullanıcının istemiyle metin üretebilmekte, metni özetleyebilmekte, değiştirebilmekte, iyileştirebilmekte, özet çıkartabilmekte ve diller arası çeviriyi hızla yapabilmektedir. Hal böyle olunca bu işlevler günlük yaşamlarının ayrılmaz bir parçası olan öğrenciler, öğretmenler, akademisyenler, gazeteciler vs için görevlerinin destekleyici bir unsuruna dönüşmektedir. LLM’lerin kapasitesi ve performansı iyileşirken insanlar tarafından kullanım oranı da sürekli artmaktadır. Kullanım oranı arttıkça bu araçlarla ilişki maalesef bir bağımlılık ilişkisine dönüşmekte, nihayetinde kendileri için destekleyici olan araçlar giderek ikame edilen araçlara dönüşmektedir.
Tam da bu noktada üretimin faili belirsizleşmektedir. Dolayısıyla, bu araçlar günlük yaşamda işlerimizi kolaylaştırırken eylemin faili insan-makine ilişkisinde giderek makineye kaymaktadır. Oldukça kapsamlı ve derin etkileri olan bir sorunla karşı karşıyayız. Bu nedenle, özellikle eğitim sisteminde ve bilimsel alanda ödevlerin, makalelerin, yazıların failini belirginleştirmeye yönelik yeni yaklaşımlar üretilmeye başlanmıştır. Eğitim sistemlerinde öğrencinin ürettiği bir ürünün faili öğrenci mi yoksa makine mi sorusuna cevap elde etmek için yeni ölçme değerlendirme yaklaşımları geliştirilmeye çalışılmaktadır. Bu yaklaşımlara bakıldığında failliği belirmede klasik sözlü sınavların ve sohbet merkezli münazaraların giderek tekrar alternatif haline geldiği görülüyor.
Diğer taraftan, özellikle bilimsel alanda üretilen makalelerin ne ölçüde bu araçlar tarafından üretildiği, yani makalenin gizli yazarları olup olmadığına dair yapay zekâ detektörleri geliştirilmeye çalışılmaktadır. Ancak, bu araçların yetersizliklerinin ötesinde başka derin komplikasyonlara yol açtıkları görülmektedir. Öncelikle bu tespit araçlarının neyi ölçtüklerine bakmak gerekiyor. Bu araçlar, bir metinde insan yazısı ile LLM çıktısı arasında istatistiksel olarak ayırt edilebilir bir iz bulunduğunu kabul etmekte, dolayısıyla genellikle dilin öngörülebilirliği, kelime dağılımları, tekrar örüntüleri, cümle uzunluğu varyansı ve söz dizimsel düzenlilik gibi yüzeysel olasılıksal özellikleri analiz ederek bir karara varmaktadır. Birinci gerilim tam da bu noktada ortaya çıkmaktadır. Çünkü LLM’ler, tam da insan yazısının bu istatistiksel dağılımlarını taklit etmek üzere eğitilmişlerdir. Dolayısıyla bu araçlar, insan yazısını insan yapan bilişsel ve epistemik süreçleri değil biçimsel farkları ölçmeye çalışmakta ve modeller geliştikçe bu farklar da ortadan kalkarak yapılan ölçüm ilkesel olarak çok daha kırılgan hâle gelmektedir.
Literatürde bu durumu ampirik olarak ortaya koyan çalışmalar, detektörlerin gerçekte LLM kullanımını değil, belirli bir yazı tarzını, yani yüksek derecede düzenli, normatif ve disipliner dili işaretlediğini göstermektedir. Bu da insan tarafından üretilmiş bilginin, makinenin istatistiksel ortalamaları üzerinden yeniden yargılanması anlamına gelmektedir. Böyle bir durumda insan yazısı, kendinde meşru bir epistemik ürün olmaktan çıkarak algoritmik onaya ihtiyaç duyan bir nesneye dönüşmektedir. Diğer taraftan, özellikle akademik alanda insan yazımında da akademik klişeler, disipliner dil normları, editoryal beklentiler ve hakem geri bildirimleri ile metin zaten yüksek ölçüde standartlaştırılmaktadır. Standartlaşma arttıkça bu araçların yazımı kendilerine mal etme olasılığı artmaktadır. Bu nedenle özellikle akademik metinler, tamamen insan tarafından yazılmış olsalar bile istatistiksel olarak LLM çıktısına benzeyen bir forma sahip olabilir. Tespit araçlarının disiplinine hâkim, düzgün ve normatif insan metinlerini şüpheli olarak işaretlemesi bu yüzden şaşırtıcı değildir.
Dahası, bu araçların LLM’ler piyasaya çıkmadan önce yazılmış metinlerde bile LLM katkısı tespit edebilmesi daha derin bir soruna işaret etmektedir. Örneğin bu kapsamda yapılan ilk çalışmalardan bir tanesinde 1980–2023 yılları arasında önde gelen beş bilimsel dergiden alınan 14 bin 400 gerçek özet üzerinde yapılan analizlerde özetlerin büyük bölümünü doğru biçimde insan ürünü olarak tanımladığı, ancak %5–10’luk bir kısmını yüksek güven düzeyleriyle (hatta %90’ın üzerinde) yanlış biçimde yapay zekâ üretimi olarak işaretlediği gösterilmiştir (Journal of Pathology Informatics, 14, 2023, 100342). Sorun hatanın matematiksel olarak kabul edilebilir olup olmamasının çok ötesindedir. Bir tane bile yanlış pozitif, ilgili akademisyenler hakkında, çalışmalarının tamamen özgün olmasına rağmen kariyerlerini etkileyebilecek suçlamalarla karşılaşmaları gibi büyük bir maliyeti taşımaktadır ve kabul edilemezdir.
Bu durum aslında bu araçların gerçekten LLM kullanımını tespit etmediğini; yalnızca belirli bir yazı tarzını, yani yüksek derecede düzenli, ortalama ve normatif dili işaretlediğini göstermektedir. Bir başka deyişle, bu araçlar aslında geriye dönük olarak zımnen ve dolaylı olarak söz konusu metnin, bugün LLM’lerin üretmeye eğilimli olduğu türden bir metne benzediğini ima etmektedir. Bu araçların sadece bu yargısı bile bu araçların nedensel bir çıkarım yapmadıklarını, yalnızca biçimsel bir benzerlik aradıklarına işaret etmektedir. Dolayısıyla, nedensellik ile benzerlik birbirine karıştırılmaktadır. Dolayısıyla, tespit araçları, bir metnin LLM tarafından üretilip üretilmediğinin nedensel kararını değil, LLM’lerin tipik çıktılarıyla istatistiksel benzerliğini ölçmektedir. Ancak benzerlik, kullanımın kanıtı değildir. Aynı mantıkla, yukarda değindiğimiz gibi iyi yazılmış bir akademik makale, titiz bir editörlük sürecinden geçmiş bir metin ya da alanın yerleşik dilini kullanan bir çalışma kolaylıkla LLM benzeri olarak etiketlenebilecektir. Böyle bir düzende akademik dürüstlük, insan muhakemesine dayanan etik bir ilke olmaktan çıkıp, makinenin istatistiksel eşiğini aşma meselesine indirgenmektedir. Bu durum özellikle öğrenciler ve ana dili İngilizce olmayan akademisyenler açısından yanlış pozitif değerlendirme riskini artırmaktadır.
Dolaysıyla, faili belirleme iddiasıyla çıkılan ve bu nedenle aslında meşru görünen yolda epistemik bir problem üretilmektedir. Bu araçlar yazarlığı metnin yüzey özelliklerine indirgemekte, niyet, muhakeme süreci, kaynak seçimi, kavramsal katkı ve entelektüel sorumluluk gibi unsurları tamamen dışarıda bırakmaktadır. Oysa akademik dürüstlük, bir metnin nasıl göründüğüyle değil, nasıl üretildiği ve hangi yargı süreçlerinden geçtiğiyle ilgilidir. Bu nedenle giderek artan sayıda çalışma, LLM tespitine dayalı gözetimci yaklaşımların hem bilimsel hem de etik açıdan savunulamaz olduğunu ifade etmektedir. Kısaca, bu araçların yetersizliği tesadüf değildir. LLM’lerin insan dilinin istatistiksel yapısını içselleştirmiş olması, akademik yazının zaten yüksek ölçüde standartlaşmış bir form taşıması ve benzerliğin nedensellik sanılması, sadece bu sistemlerin tespitlerine dayalı olarak verilecek bir kararı güvenilmez kılmaktadır.
Bu noktada başka bir sorunla daha karşılaşmaktayız. Bu araçların yaygınlaşmasıyla bu kapsamda üretim yapan insan ürünlerine kuşkuyla bakma ve nihai faili belirlemede de tekrar insan yerine makinelerin kararına güvenme gibi insana yabancılaşan bir ekosistemin giderek güçlenmesidir. Bu ekosistemde yapay zekâ araçları bugün yalnızca metin üreten sistemler olarak değil, aynı zamanda bu metinlerin değerlendirilmesinde, sınıflandırılmasında ve hatta meşruiyetinin tayininde kullanılan araçlar hâline dönüşmektedir. Başka bir deyişle, insan yazısı artık kendinde bir ölçüt olmaktan çıkmakta, meşruiyetini, bir algoritmanın onayından geçerek kazanmaktadır. Bu da bilginin epistemik statüsünü insan aleyhine sessizce dönüştürmektedir.
Bu ekosistem, doğal olarak yapay zekânın epistemik otoritesini pekiştiren bir etki üretmektedir. Çünkü karar artık ‘bu metni kim, hangi niyetle ve hangi muhakeme süreciyle üretti’ sorusuna değil, ‘bu metin, modelin öğrendiği istatistiksel dağılımlara ne kadar uyuyor’ sorusuna kaymaktadır. Böyle bir kayma, bilginin doğruluğunu ve sahiciliğini insan yargısından kopararak, makinenin sınırlı fakat otoriter görünen değerlendirme kapasitesine teslim etmektedir. Dahası, bu otorite, çoğu zaman şeffaf değildir ve itiraz edilebilirliği oldukça düşüktür. Yanlı çalışan çoğu algoritmanın çıktılarında görüldüğü gibi kendi kendini doğrulayan bir kehanet tekrar devrede girmektedir. Daha da sorunlu olan, bu epistemik otoritenin kendini geriye dönük olarak da dayatabilmesidir. LLM’ler ortada yokken yazılmış metinlerin bile LLM katkılı olarak değerlendirilmesi, makinenin yalnızca bugünü değil, geçmişi de kendi otoritesi açısından yeniden sınıflandırma eğilimini göstermektedir.
Dolayısıyla mesele sadece yanlış pozitifler ya da teknik hatalar değildir. Burada yapay zekânın, hem üretici hem de hakem olarak konumlanması gibi daha derin bir epistemik risk bulunmaktadır. Bu çift rol, insan failin sorumluluğunu ve özerkliğini aşındırırken, bilginin meşruiyetini giderek algoritmik onaya bağlayan bir düzeni normalleştirmektedir. Bir başka deyişle, yapay zekânın hem metin üretiminde hem de bu metinlerin insan failine ait olup olmadığını belirlemede kullanılması, bilginin sorumluluğunu ve yazarlık kavramını insan muhakemesinden algoritmik onaya doğru kaydırmaktadır. Özellikle yapay zekâ detektörlerinin, LLM’ler tarafından üretilmemiş metinleri dahi makine ürünü olarak değerlendirebilmesi, bu araçların nedensel değil biçimsel ölçütlerle çalıştığını ve buna rağmen fiilî bir epistemik otorite kazandığını göstermektedir. Bu durum zamanla normalleştirildikçe, insan üretimine yönelik yapısal bir kuşku kültürü oluşmakta; akademik dürüstlük, etik bir ilke olmaktan çıkıp algoritmik eşikleri aşma meselesine indirgenmektedir. Süreç, önce bu araçların yardımcı ve zararsız denetim mekanizmaları olarak sunulmasıyla başlarken nihayetinde insan yargısının tali hâle gelmesiyle sonuçlanmaktadır. Dolaysıyla, yaşanan derin bir epistemik dönüşümdür.
Çözüm ise daha iyi dedektörler geliştirmekten ziyade, akademik üretimde sorumluluğu, şeffaflığı ve insan yargısını merkeze alan yeni çerçeveler geliştirmekten geçmektedir. Yapay zekâ detektörleri ne kadar gelişirse gelişsinler, yazarlığı metnin yüzeysel özelliklerinden hareketle güvenilir biçimde belirleyemezler. Çünkü sorun, modellerin henüz yeterince hassas olmaması değil, insan yazısının, özellikle akademik bağlamda, zaten yüksek ölçüde standartlaşmış olması ve LLM’lerin bu standartlaşmış dili başarıyla taklit edebilmesinden kaynaklanmaktadır. Bu nedenle daha iyi dedektörler, en iyi ihtimalle yanlış pozitifleri azaltabilirler.
Bu nedenle, yazarlığı ve akademik dürüstlüğü metnin biçiminden değil, üretim sürecinden hareketle ele alan yeni çerçeveler geliştirmemiz gerekiyor. Burada metni kimin yazdığına dair çoğu zaman yanlış cevap üreten istatistiksel tahminler yapmak yerine belki de LLM kullanımının hangi aşamada, ne amaçla ve hangi sınırlar içinde kullanıldığının açıkça beyan edilmesinin insan failin sorumluluk kapsamına alınması gerekmektedir. Böylece mesele ‘kullandın mı kullanmadın mı’ itirafından çıkartılarak, ‘nasıl ve ne ölçüde kullandın’ sorusuna taşınmalıdır. Dolayısıyla, şeffaflık bu çerçevenin en önemli ayağını oluşturmalıdır. LLM kullanımının gizlenmesi gereken bir suç faaliyeti gibi değil, açıklanması gereken bir yöntem tercihi olarak ele alınması gerekmektedir. Nasıl ki istatistiksel yazılımların, çeviri araçlarının ya da editoryal desteklerin kullanımı açıkça belirtiliyorsa, yapay zekâ araçlarının katkısının da benzer biçimde görünür kılınması yaygınlaştırılmalıdır. Bu yaklaşım, hem haksız suçlamaların önüne geçebilecek hem de insan katkısının nerede başladığını ve nerede yoğunlaştığını daha da belirginleştirecektir.
Ayrıca, bu süreçte insan yargısı tekrar merkeze alınmadır. Ölçme ve değerlendirme, ister eğitimde ister akademik yayıncılıkta olsun, nihai olarak otomatik sınıflandırmalara devredilemeyecek bir faaliyettir. Metnin sahibinin konuyu ne kadar kavradığı, argümanlarını nasıl gerekçelendirdiği ve eleştirel sorular karşısında nasıl savunduğu ancak insan yargısıyla anlaşılabilir. Bu nedenle sözlü sınavlar, mülakatlar, savunmalar, süreç odaklı değerlendirmeler ve metin üzerine yapılan yüz yüze tartışmalar yeniden merkezi önem kazanmaktadır. Benzer şekilde akademi dünyasında uzun geçmişi olan akran değerlendirmesi tekrar güçlendirilmelidir. Dolayısıyla çözüm, daha sofistike gözetim mekanizmaları inşa etmekten değil, sorumluluğu insanda bırakan, süreci görünür kılan ve yargıyı yeniden insanî ilişkilere dayandıran kurumsal ve etik çerçeveler geliştirmekten geçmektedir.