Yapay Zekâ · 23 Ağustos 2026 · 3 dk okuma
Multimodal AI Nedir? Metni, Görseli ve Sesi Birlikte Anlamak
Multimodal yapay zekâ nedir, nasıl çalışır? Metin, görsel, ses ve videoyu aynı modelde işlemenin mantığı, pratik kullanımları ve bugünkü sınırları.
Kısa cevap
Multimodal yapay zekâ, metnin yanında görsel, ses ve video gibi farklı veri türlerini aynı model içinde birlikte işleyebilen sistemdir. Bir ekran görüntüsünü görüp hatayı okuyabilmesi ya da bir fotoğraf hakkında konuşabilmesi bu yetenekten gelir.
"Modalite", verinin türü demektir: metin bir modalite, görüntü başka, ses bir başkası. Uzun süre her modalitenin ayrı modeli vardı; metni bir model anlar, görseli başka bir model sınıflandırırdı. Multimodal model, bunları tek bir sistemde birleştirir: aynı model hem yazıyı okur, hem fotoğrafa bakar, hem sesi dinler ve hepsini birlikte değerlendirerek cevap verir.
Pratikte bunun anlamı şu: artık yapay zekâya bir şeyi anlatmak zorunda değilsiniz, gösterebiliyorsunuz. Ekran görüntüsünü yapıştırıp "burada ne yanlış?" diye sormak, hatayı kelimelerle tarif etmeye çalışmaktan hem hızlı hem doğru.
Multimodal model nasıl çalışır?
Kilit fikir ortak temsil uzayıdır. Embedding yazısında anlattığım gibi, modeller anlamı sayı dizilerine çevirir. Multimodal modellerin yaptığı, farklı türden girdileri aynı sayı uzayına çevirmektir.
Yani "sarı bir taksi" cümlesi ile sarı bir taksinin fotoğrafı, bu uzayda birbirine yakın noktalara düşer. Model, milyonlarca görsel-açıklama çiftinden bu eşleşmeyi öğrenmiştir. Aynı uzayda buluştukları için de birlikte akıl yürütülebilir hale gelirler.
Sonra iş, tanıdık mekanizmaya devredilir: görsel de metin gibi parçalara bölünüp token'lara çevrilir ve dil modelinin bağlam penceresine girer. Modelin gözünde, resmin parçalarıyla cümlenin kelimeleri aynı akışın parçasıdır. Bu yüzden bir görselin de bir maliyeti vardır ve yüksek çözünürlüklü bir ekran görüntüsü, uzunca bir metin kadar yer kaplayabilir.
Pratikte ne işe yarıyor?
Ürün tarafında somut karşılıkları şunlar:
- Destek ve hata ayıklama: Kullanıcının gönderdiği ekran görüntüsünden sorunu okumak. Destek geçmişimden biliyorum: kullanıcıların çoğu sorunu tarif edemez ama ekran görüntüsü gönderebilir.
- Belge işleme: Faturayı, sözleşmeyi, teknik çizimi görüp alanlarını çıkarmak. Taranmış ve elle yazılmış belgelerde bile çalışması, klasik OCR'a göre büyük fark.
- Görsel kalite kontrolü: Bir tasarımın veya render'ın marka kurallarına uyup uymadığını kontrol etmek.
- Arayüz anlama: Ekranı görüp üzerinde işlem yapabilen yapay zekâ ajanlarının temel yeteneği budur; ajan, düğmeyi ancak görebiliyorsa tıklayabilir.
- Ses ve video: Toplantı kaydını konuşmacı ayrımıyla özetlemek, bir videonun içeriğini aramak.
Kendi alanımda en çok işime yarayan kullanım, görsel ile metni karşılaştırmak oldu: bir mimari görselin verilen brief'e sadık kalıp kalmadığını kontrol ettirmek gibi. AI görselinde tasarım sadakati yazısında tartıştığım sorunun, artık kısmen ölçülebilir bir tarafı var.
Sınırları neler?
Abartılmaması gereken yerler de var:
- Ölçü ve konum zayıflığı: Model bir görselde ne olduğunu iyi anlar, ama "bu duvar kaç metre?" veya "soldan üçüncü nesne" gibi kesin uzamsal sorularda güvenilmez olabilir.
- Küçük yazı ve yoğun tablo: Düşük çözünürlüklü ekran görüntülerindeki ince metinleri karıştırabilir. Kritik sayıları okutuyorsanız doğrulama katmanı koyun.
- Kendinden emin hata: Yanlış okuduğunda da aynı özgüvenle cevap verir. Halüsinasyon riski görselde de geçerlidir.
- Maliyet: Görsel girdi, metne göre belirgin biçimde daha fazla işlem yükü demektir; maliyet hesabını buna göre kurun.
Ürün tarafında ne değişiyor?
En büyük değişiklik, girdi tasarımının kendisi. Yıllardır kullanıcıdan veriyi biz istedik: form doldur, alan seç, kategori işaretle. Multimodal modeller bu yükü azaltıyor; kullanıcı fotoğrafı çekiyor, gerisini sistem çıkarıyor.
Kullanıcının prompt yazmak zorunda kalmaması gerektiğini savunduğum yazının bir adım ilerisi bu: kullanıcı artık tarif etmek zorunda da kalmamalı. Ürün insanı için soru şuna dönüşüyor: hangi formu bir fotoğrafla değiştirebiliriz?
Sıkça sorulan sorular
Multimodal model kullanmak daha mı pahalı?
Genelde evet, çünkü görsel ve ses girdileri metne göre çok daha fazla token karşılığı gelir. Yüksek çözünürlüklü bir görsel, birkaç sayfalık metin kadar maliyet yaratabilir. Görselleri ihtiyaç duyulan en düşük çözünürlükte göndermek, en kolay tasarruf kalemidir.
Görseli anlamak ile görsel üretmek aynı şey mi?
Değil. Anlama (görseli okuyup yorumlama) ile üretme (sıfırdan görsel oluşturma) farklı yeteneklerdir ve farklı mimarilere dayanır. Bazı modeller ikisini birden yapar, bazıları yalnızca anlar. Araç seçerken bu ayrımı netleştirin.
Türkçe metin içeren görsellerde başarılı mı?
Basılı ve net metinlerde genelde iyi sonuç verir. Zorlandığı yerler el yazısı, düşük çözünürlük ve Türkçe karakterlerin bozuk göründüğü taramalardır. Kritik veri çıkarımında sonucu bir kural katmanıyla doğrulamak gerekir.
Hangi işlerde henüz güvenmemeli?
Ölçü, sayım ve kesin konum gerektiren işlerde; tıbbi ve hukuki nihai kararlarda; bir de görselden okunan sayının doğrudan para veya hukuki sonuç ürettiği akışlarda. Bu alanlarda modeli karar verici değil, ön eleme yapan bir asistan olarak konumlandırmak doğru olanıdır.
Etiketler