Araba kazalarına karışan herkes su içmiştir; o zaman su içmek araba kazalarına yol açmaktadır.
Bu sonucun absürtlüğü bariz olsa da, veri biliminde nedensellik ve korelasyonun ayrımını yapmak her zaman bu kadar kolay olmayabiliyor. Günlük hayatımızda rakamlarla iç içe yaşıyoruz ve gerek haberlerde gerekse anketlerde veriyle karşılaşıyoruz. Bu yazıda verileri doğru yorumlama ve anlama ile ilgili birkaç temel anlatıya değinip veri okuryazarlığından bahsedeceğim.
Korelasyon ve Nedensellik
Korelasyon, iki değişkenin birlikte değişim göstermesidir. Bir değişken artarken diğeri artıyorsa, biri azalırken diğeri azalıyorsa, korelasyonun bulunduğu söylenebilir. Örneğin, aldığınız kalori arttıkça, kilonuz da artar veya derslere katılım oranınız arttıkça, sınavlardaki notunuz da artar. Ancak korelasyon her zaman değişkenlerden birinin diğerine neden olduğunu göstermez. Nedensellik, bir değişkenin diğerinin değişiminde etkili olmasıdır. Örneğin, dondurma yemek ve denizde boğulmak arasında korelasyon vardır. Evet, gerçekten. Aslında bunun nedeni iki olayın da artışlarının benzer dönemlerde, yani yaz aylarında yaşanmasıdır. Veri okuryazarlığı hakkındaki bu yazıyı okumamış bir birey, yazımın başında yaptığım gibi yanlış bir çıkarım yaparak dondurma yemenin boğulmaya neden olduğunu düşünebilir. Veri okurken bu yanlışlara düşmemek için korelasyon ve nedensellik arasındaki farkı anlamak önemlidir. Korelasyonun nedensellik ile karıştırılması kimi zaman yaz mevsiminin gelmesi gibi görmezden gelinen bir üçüncü değişkenle açılırken, kimi zaman da tamamen tesadüfler sonucu oluşur. Korelasyon ve nedensellik haberlerde sıkça karıştırılabilmekte ve iddialı söylemlere yol açabilmektedir. Örneğin, diyet kolanın kilo almaya yol açtığını verilerle de destekleyerek savunabiliriz. Ancak burada göz ardı edilebilen etken genellikle halihazırda kilo almaktan şikayetçi olan insanların diyet kola içmeyi tercih etmesidir. Bu nedenle diyet kola içen insanların yüksek kilolu olduğu korelasyonunu elde etmekteyiz, fakat bunun nedensellik olmadığı fark edilmeli.
Ortalama ve Medyan Farkı
veri setinin ortalaması, değerlerin toplamının değer sayısına bölünmesi ile bulunur. Medyan ise bu değerlerin küçükten büyüğe sıralandığında ortada kalan değerdir. Benzer görünseler de kimi zaman çok farklı durumlar anlatabilirler. Anlatımlarındaki bu farklılık ise veri okumak açısından büyük önem taşımaktadır. Medyan ve ortalamanın farkı anlatılırken kullanılan ünlü örneklerden biri farkı daha net anlamanızı sağlayacaktır. Sıradan bir restoranda asgari ücret ile çalışan 10 kişi otururken içeri bir anda Bill Gates girince restorandaki herkes ortalama olarak bir milyarder olmakta. Çünkü toplam servet milyarlarca dolar ve restorandaki 11 kişiye eşit olarak bölünmekte. Medyana baktığımızda ise neredeyse hiç değişmemekte. Bu nedenle, veri setlerinde ilişkileri anlatırken medyan ve ortalamanın kullanımının farkını anlamak veri biliminin temellerinden biridir. Özellikle sosyal medyada ve haberlerde “ortalama” iddiasının kullanımına dikkat etmeniz kandırılmanızı önleyebilir. Örneğin, ben ve Messi ortalama 4’er kez futbolda yılın en iyisi seçilerek Ballon d’Or ödülünü kazandık. Aslında düşündüğümüzde bu anlatımda hiçbir yanlış veri veya bilgi bulunmamakta. Bu anlatım benim mükemmel bir futbolcu olduğumu kanıtlamam yönünde kullanılabilir görünse de aslında Messi’nin 8 Ballon d'Or’undan benim pay almamdan başka bir şey olmamakta. Bu örnek bize uç değerlerin (outlier) ortalama üzerinde büyük etkisi olabildiğini kanıtlamakta ve özellikle değer sayısının az olduğu durumlarda “ortalama” iddialarına dikkat etmek gerektiğini göstermekte.
Hayatta Kalma Yanılgısı
Her ne kadar veri okumanın daha birçok püf noktası ve temeli olsa da, bu yazımda bahsedeceğim son şey hayatta kalma yanılgısı, yani İngilizce adıyla “Survivorship Bias” olacak. Hayatta kalma yanılgısı veriyi analiz ederken yalnızca “hayatta kalan”, yani yalnızca başarılı olan, özellikle seçilen birtakım veriye odaklanmaktır. Bu hatada yalnızca belirli bir veri türüne odaklanıldığı için ulaşılan sonuç da hatalı veya eksik olmaktadır. Bu yanılgının anlatımı genel olarak İkinci Dünya Savaşı sırasında yaşanan bir olay ile yapılmaktadır. İkinci Dünya Savaşı sırasında Amerikan ordusu uçaklarının zırhını güçlendirmek istemiş ve bunun için cepheden dönen uçakların nerelerden vurulduğunu analiz etmiştir. Savaştan dönen uçakların kanatlarında ve birkaç farklı bölgesinde fazla mermi deliği olduğu için buraların güçlendirilmesi gerektiğini düşündüler. Fakat matematikçi Abraham Wald hayatta kalan yanılgısına düştüklerini ve bu bölgelerin değil, mermi deliği olmayan motor gibi bölgelerin güçlendirilmesini önerdi. Çünkü analiz edilen uçaklar zaten cepheden geri dönebilen uçaklardı. Motor gibi daha önemli bölgelerden vurulan uçaklar ise zaten cepheden dönemediği için ilk bakışta motor bölgesinin zırha ihtiyaç duymadığı düşünülmüştü. Buradaki hata hayatta kalma yanılgısıydı ve verinin yalnızca geri dönen uçaklara odaklanmasından doğmuştu. Günlük hayatta da sıkça Mark Zuckerberg ve benzer bir sürü milyarderin veya girişimcinin üniversiteyi bıraktığını görüyoruz. Bu anlatımdan yola çıkarak üniversiteyi bırakmanın başarıya yol açtığı yönünde mantıksız bir sonuca ulaşabiliriz. Ancak bu anlatımın sebebi üniversiteyi bırakıp da başarısız olan binlerce insanın hikayesini duymamamız, basında bu örneklerin karşılık bulmamasıdır. Yani esasen hata yine yalnızca verinin belirli bir kısmına, anlatımımız için işimize gelen kısmına, odaklanmaktır. Bu nedenle bir istatistik ile karşılaştığımızda veri setinin neleri barındırdığına ve neleri göz ardı ettiğine ve hayatta kanılma yanılgısının varlığına dikkat etmeli, her duyduğumuz istatistiğe ve anket sonucuna körü körüne inanmamalıyız.
Özellikle yapay zekanın gün geçtikçe inanılmaz bir hızda geliştiği bu çağda istatistiklere, grafiklere veya “bilim adamlarına göre” ile başlayan klişe cümlelere dahi inanmadan önce kaynağı sorgulamak ve anlatıma dikkat etmek gerekir. Ne de olsa, istatistik yalan söylemese de, doğru kelimelerin seçilmesi ile istatistik yanlış yorumlanabilir. Veri yalan söylemiyor ama biz yanlış okuyor olabiliriz. Bu nedenle hepimizin veri okuryazarlığı konusunda gelişmesi kandırılmamızın ve manipülasyona uğrama ihtimalimizin azaltılmasını sağlayacaktır. Sormanız gereken temel sorulardan bazıları ise şunlar: “Bu iki şey birbirine neden oluyor? Bu veri seti ne kadar değer barındırıyor? Hangi veriler görmezden gelinmiş? Burada ortalamanın kullanımı doğru mu?”