Yazılımcı değilim; yapay zekâyla üç deneyden notlar

CourtScribe, Angel Lens ve VisemIQ'yu geliştirirken öğrendiklerim

Yazılımcı değilim. Finans, yatırım ve spor alanında yıllar içinde biriktirdiğim bilgiyi yapay zekâ araçlarıyla birleştirerek nereye kadar gidebileceğimi test ediyorum. Son aylarda bu merakın üç somut sonucu oldu: maç videosundan basketbol istatistiği çıkaran CourtScribe, melek yatırımcılar için bir analiz aracı olan Angel Lens ve sessiz videodan dudak okumaya çalışan VisemIQ.

Üçü de bitmiş ürün değil; üçü de deney. Ama her biri, “yapay zekâ ile kim ne yapabilir?” sorusuna dair bana bir şey öğretti.

CourtScribe: Alan bilgisi koddan daha belirleyici

Amatör ve altyapı basketbolunda istatistik çoğu zaman hiç tutulmuyor ya da elle, eksik tutuluyor. Hedefim basitti: Bir maç videosunu sisteme vermek ve oyuncu bazında sayı, ribaund, asist, top çalma, blok, top kaybı ve faul tablosu almak.

Sistem oyuncuları ve topu görüntüde bulan, oyuncuları kareden kareye takip eden, forma numaralarını okuyan ve spikerin anlatımını metne çeviren parçalardan oluşuyor. Şu an 14. sürümde. Bu yolda öğrendiğim ilk ders şu oldu: Her şeyi tek seferde yapmaya çalışan sürüm başarısız oldu. Oyuncular kayboldu, top tespiti çöktü. İşe yarayan, her sürümde tek bir sorunu çözmek ve oyuncu takibini top tespitinden ayırmaktı.

İkinci ders daha şaşırtıcıydı. Türkçe basketbol anlatımındaki hataları düzeltmek için kurduğum sözlük, varsayımlarla değil gerçek transkriptlerdeki hatalarla kurulduğunda işe yaradı. Burada basketbol bilgisi, koddan daha belirleyici oldu. Hangi kelimenin “ribaund”, hangisinin “blok” olduğunu bilen kişi, modelin neyi yanlış duyduğunu da görebiliyor.

Üçüncü ders ise sınırı kabul etmekti. Geniş açılı, hareketli amatör çekimlerde tam otomatik analiz henüz güvenilir değil. Bu yüzden paralel bir yol denedim: maçı izlerken sesle anlatıp anlatımı istatistik tablosuna çeviren basit bir uygulama. Bazen doğru çözüm, insanı döngünün içine geri koymak.

Angel Lens: Modele “emin değilim” demeyi öğretmek

Girişim sermayesinde yıllarca kullandığım değerlendirme disiplinini, melek yatırımcıların da kullanabileceği bir araca dönüştürmek istedim. Angel Lens, bir girişimin sunum dosyasından kurumsal bir yatırım komitesi notuna benzeyen, yapılandırılmış bir analiz üretiyor: pazar, rekabet, ekip, finansal profil, değerleme senaryoları, risk matrisi ve görüşmede sorulacak sorular.

Buradaki en önemli ders beklemediğim bir yerden geldi. Model, verisi eksik kriterlere sıfır puan veriyordu. Bu teknik olarak “doğru”, ama yatırım açısından yanıltıcıydı: Bilgi yokluğu ile kötü bir sonuç aynı şey değil. Talimatları, eksik veride düşük güvenle geçici bir puan verecek şekilde değiştirdim. Ders şuydu: Modele yalnızca ne yapacağını değil, emin olmadığında bunu nasıl ifade edeceğini de öğretmek gerekiyor. Bu, iyi bir analistten beklediğimiz şeyin aynısı.

Diğer dersler daha pratikti. Büyük PDF’leri olduğu gibi göndermek yerine metni tarayıcıda çıkarmak, gönderilen veriyi megabaytlardan kilobaytlara indirdi. Canlı web araması eklemek hız sınırlarına takıldı; o özelliği kaldırdım. Değerlendirme çerçevesini gerçek bir yatırım notuna ve kriter setine dayandırmak ise çıktının tutarlılığını belirgin şekilde artırdı.

VisemIQ: Zor problemi zor olarak kabul etmek

VisemIQ’nun adı, projenin temel zorluğundan geliyor. Dudak okumada aynı dudak hareketi (viseme) birden fazla sese karşılık gelebiliyor. Bu yüzden görüntüden konuşma okumak, sesli konuşma tanımadan çok daha zor bir problem. İlk sürüm İngilizce konuşmayı dudak hareketlerinden okuyor. Türkçe dudak okuma ise bir sonraki araştırma aşamasında.

Şimdiye kadarki en umut verici gözlem, ham çıktıyı bir dil modeliyle bağlama oturtmanın okunabilirliği artırması. Sırada sınırlı sayıda kullanıcıyla kapalı bir demo var.

Üç deneyden çıkardığım notlar

  1. Alan bilgisi hâlâ en değerli girdi. Yapay zekâ kod yazmayı kolaylaştırıyor. Ama neyin doğru olduğunu bilen kişi olmayı kolaylaştırmıyor.
  2. Her sürümde tek bir sorun. Büyük adımlar değil, küçük ve ölçülebilir adımlar ilerletiyor.
  3. Belirsizliği tasarlamak gerekiyor. İyi bir sistem, bilmediğini söyleyebilen sistemdir.
  4. Otomasyonun sınırını bilmek de bir çözüm. Bazen en iyi ürün, insanı dışarıda bırakan değil, işini kolaylaştıran üründür.
  5. Maliyet ve sınırlar tasarımın parçası. Hız sınırları ve API maliyetleri, hangi özelliğin kalacağına ve demonun herkese açık olup olmayacağına doğrudan etki ediyor.

Bu deneylerin ayrıntılarını AI Lab’da paylaşmaya devam edeceğim. Bu alanda deney yapan başka “yazılımcı olmayanlarla” not karşılaştırmaktan da memnuniyet duyarım.

Finans & Yatırım3 dk okuma

Neden gençlere finansal okuryazarlık anlatıyorum

İlk gelir, ilk kredi kartı ve ilk yatırım, bir gencin finansal hayatının en kritik anları. Paranın İlk Adımları'nı neden hazırladığımı anlatıyorum.