VisemIQ
Sesi olmayan bir videodan, yalnızca dudak hareketlerine bakarak konuşmayı metne çevirmeye çalışan bir görsel konuşma tanıma denemesi.
- Soru
- Ses olmadan, yalnızca görüntüden konuşma okunabilir mi?
- Durum
- Prototip
- Başlangıç
- Eylül 2026
- Araçlar
- Görsel konuşma tanıma
- Büyük dil modelleri
- Python
- Claude
Neyi çözmeye çalıştım
Ses kaydının olmadığı ya da kullanılamadığı videolarda ne konuşulduğunu anlamak. İnsanlar için dudak okumak hem sınırlı hem de çok yorucu bir beceri; yapay zekânın bu işte nereye kadar gidebildiğini görmek istedim.
Ne yaptım
İlk sürüm, İngilizce konuşmayı dudak hareketlerinden okuyor; arayüz Türkçe ve sonuçlar Türkçeye çevrilebiliyor. Türkçe videolar için dil altyapısını ve otomatik dil tespitini kurdum. Türkçe dudak okuma ise bir sonraki araştırma aşamasında.
İlk gözlemler
- Dudak okuma, sesli konuşma tanımadan çok daha zor bir problem: aynı dudak hareketi (viseme) birden fazla sese karşılık gelebiliyor. Projenin adı da buradan geliyor.
- Ham çıktıyı bir dil modeliyle bağlama oturtmak, okunabilirliği artırmanın en umut verici yolu gibi görünüyor.