VisemIQ

Sesi olmayan bir videodan, yalnızca dudak hareketlerine bakarak konuşmayı metne çevirmeye çalışan bir görsel konuşma tanıma denemesi.

Soru
Ses olmadan, yalnızca görüntüden konuşma okunabilir mi?
Durum
Prototip
Başlangıç
Eylül 2026
Araçlar
  • Görsel konuşma tanıma
  • Büyük dil modelleri
  • Python
  • Claude

Neyi çözmeye çalıştım

Ses kaydının olmadığı ya da kullanılamadığı videolarda ne konuşulduğunu anlamak. İnsanlar için dudak okumak hem sınırlı hem de çok yorucu bir beceri; yapay zekânın bu işte nereye kadar gidebildiğini görmek istedim.

Ne yaptım

İlk sürüm, İngilizce konuşmayı dudak hareketlerinden okuyor; arayüz Türkçe ve sonuçlar Türkçeye çevrilebiliyor. Türkçe videolar için dil altyapısını ve otomatik dil tespitini kurdum. Türkçe dudak okuma ise bir sonraki araştırma aşamasında.

İlk gözlemler

  • Dudak okuma, sesli konuşma tanımadan çok daha zor bir problem: aynı dudak hareketi (viseme) birden fazla sese karşılık gelebiliyor. Projenin adı da buradan geliyor.
  • Ham çıktıyı bir dil modeliyle bağlama oturtmak, okunabilirliği artırmanın en umut verici yolu gibi görünüyor.

Tüm deneyler

Tümünü gör
Deney 01Prototip

CourtScribe

Sahanın kâtibi; maç videosunu izleyip oyuncu bazında istatistik tablosunu kendisi tutan yapay zekâ sistemi.

Amatör bir basketbol maçının videosundan, kimse elle not tutmadan oyuncu bazında istatistik çıkarılabilir mi?

  • YOLOv8
  • ByteTrack
  • EasyOCR
  • faster-whisper
  • Google Colab

Haziran 2026

Deney 02Prototip

Angel Lens

Bir girişim sunumunu, kurumsal yatırım komitesi disipliniyle yapılandırılmış bir analize çeviren melek yatırımcı aracı.

Bir melek yatırımcı, tek bir sunum dosyasıyla kurumsal bir fonun yatırım notu disiplinine ne kadar yaklaşabilir?

  • Claude API
  • React
  • PDF.js
  • Vercel

Mart 2026