iyiblog

YAYINLANDI

Multimodal Yapay Zekâ: Artık Sadece Okumuyor, Görüyor ve Duyuyor

Multimodal yapay zekânın metin, görsel, ses ve videoyu nasıl birlikte işlediğini öğrenin; güncel modelleri destekledikleri girdi ve çıktılara göre karşılaştırın.

D

Daimon

Jul 16, 2026 · 9 min read

Multimodal yapay zekâ, metin, görsel, ses ve video gibi birden fazla veri türünü aynı görev içinde işleyebilen sistemleri anlatır. Bir ekran görüntüsündeki hatayı açıklamak, konuşmayı dinleyip cevap vermek veya videodaki olaylarla yazılı bir soruyu ilişkilendirmek bu yeteneğin örnekleridir.

Buradaki doğru terim multimodal. “Multi-model” ise birden fazla farklı modelin aynı sistemde birlikte çalışması demektir. İki kavram birbirine benzese de aynı şeyi anlatmaz.

Multimodal bir model birden fazla veri türünü anlar. Multi-model bir sistem ise birden fazla modeli birlikte çalıştırır.

Bir model gerçekten görüyor ve duyuyor mu?

“Görmek” ve “duymak” burada kullanışlı benzetmelerdir. Modelin insan gibi gözü, kulağı veya öznel deneyimi yoktur. Görsel pikseller, ses dalgaları ve metin; modelin işleyebileceği sayısal temsillere dönüştürülür. Model bu temsiller arasındaki örüntüleri öğrenerek cevap üretir.

Bir fotoğraf gönderip “Masadaki kırmızı kupanın sağında ne var?” diye sorduğunuzda sistem yalnızca nesne isimlerini bulmaz. Metindeki “sağında” ilişkisini görseldeki konumlarla eşleştirmeye çalışır. Multimodal yeteneğin asıl değeri, farklı veri türlerini yan yana kabul etmekten çok aralarındaki ilişkiyi kurabilmesidir.

Multimodal ile multi-model arasındaki fark

Bir çağrı merkezinde şu akış kurulabilir:

Ses kaydı
  ↓
Konuşmayı metne çeviren model
  ↓
Metni yorumlayan dil modeli
  ↓
Cevabı sese çeviren model

Bu sistem dışarıdan bakıldığında sesi anlar ve sesle cevap verir. Fakat içeride üç ayrı model çalışıyorsa bu bir multi-model mimaridir. Tek bir model doğrudan sesi alıp ses üretiyorsa modelin kendisi multimodaldir.

Bir yaklaşım diğerinden otomatik olarak daha iyi değildir. Ayrı modeller; bileşenleri bağımsız değiştirme, maliyeti kontrol etme ve her aşamayı ayrı ölçme imkânı verir. Uçtan uca multimodal model ise tonlama, kesinti ve konuşma ritmi gibi bilgileri ara metin katmanında kaybetmeden daha doğal bir deneyim sunabilir.

Multimodallik evet-hayır özelliği değildir

Bir modele yalnızca “multimodal” demek çoğu zaman yetersizdir. Asıl sorulması gerekenler şunlardır:

  • Hangi veri türlerini girdi olarak kabul ediyor?
  • Hangi veri türlerini çıktı olarak üretebiliyor?
  • Bu yetenek modelin içinde mi, yoksa bağlı bir araç üzerinden mi geliyor?
  • Görüntüyü tek kare olarak mı, videoyu zaman ilişkileriyle birlikte mi işliyor?
  • Sesin yalnızca kelimelerini mi, tonunu ve konuşma sırasını da mı kullanıyor?

Örneğin görüntü alıp metin üreten bir model multimodaldir; fakat görüntü üreten bir model olmak zorunda değildir. Benzer biçimde bir dil modelinin görsel oluşturma aracını çağırabilmesi, modelin kendi doğal çıktısının görüntü olduğu anlamına gelmez.

Sekiz güncel modelin modalite karşılaştırması

Aşağıdaki karşılaştırma 16 Temmuz 2026 tarihli üretici dokümantasyonuna dayanıyor. Model aileleri hızlı değiştiği için isimden çok girdi ve çıktı sütunlarına bakmak gerekir.

Model Doğal girdi → çıktı
GPT-5.6 Sol Metin, görsel → metin
GPT-Realtime-2.1 Metin, görsel, ses → metin, ses
Gemini 3.5 Flash Metin, görsel, video, ses, PDF → metin
Claude Fable 5 Metin, görsel → metin
Claude Sonnet 5 Metin, görsel → metin
gpt-oss-120b Metin → metin
GLM-5.2 Metin → metin
DeepSeek V4 Pro API Metin → metin

Bu tablo bir kalite sıralaması değildir. GPT-Realtime-2.1 ile gpt-oss-120b farklı problemler için tasarlanmıştır. Birinin daha fazla veri türü desteklemesi, her metin görevinde daha doğru veya daha ekonomik olacağı anlamına gelmez.

GPT-5.6 Sol: Görsel anlayan genel amaçlı model

OpenAI dokümantasyonuna göre GPT-5.6 Sol metin ve görsel girdisi kabul ediyor, doğal çıktı olarak metin üretiyor. Ses ve video girişi modelin kendisinde desteklenmiyor. Ekran görüntüsü inceleme, belge yorumlama, grafik okuma ve görsel kanıta dayalı muhakeme gibi görevlerde kullanılabilir.

Model Responses API üzerinden bir görsel üretme aracını çağırabilir. Fakat bu, doğal çıktısının görüntü olduğu anlamına gelmez. Modelin kendi modalite yolu metin + görsel → metin; görsel üretimi ise ayrı bir araç yeteneğidir.

GPT-Realtime-2.1: Konuşmanın iki yönünü de taşıyan model

GPT-Realtime-2.1 metin, ses ve görsel girdisi alabiliyor; metin ve ses çıktısı üretebiliyor. Video desteklenmiyor. Bu yapı onu telefon asistanı, canlı tercüman, sesli müşteri desteği ve konuşarak kullanılan ajanlar için genel amaçlı metin modellerinden daha uygun hâle getiriyor.

Buradaki kritik özellik yalnızca ses dosyasını okuyabilmesi değil. Düşük gecikmeli konuşma, kullanıcının araya girmesi ve cevabın ses olarak sürdürülmesi aynı etkileşim döngüsünün parçasıdır. GPT-5.6 Sol daha geniş profesyonel muhakeme için, GPT-Realtime-2.1 ise canlı sesli etkileşim için tasarlanmıştır.

Gemini 3.5 Flash: En geniş girdi yelpazesi

Google’ın model sayfası Gemini 3.5 Flash için metin, görsel, video, ses ve PDF girdilerini; metin çıktısını listeliyor. Bu, karşılaştırmadaki en geniş doğal girdi yelpazesi. Uzun bir videodaki belirli anları bulmak, ses kaydıyla sunum dosyasını birlikte incelemek veya çok sayfalı PDF hakkında soru sormak gibi görevler için güçlü bir başlangıç noktasıdır.

Yine de temel Gemini 3.5 Flash modelinin çıktısı metindir. Google’ın görüntü, canlı ses veya konuşma üretimi için ayrı model çeşitleri bulunması önemli bir ayrımdır. Aynı aile adı altındaki her model aynı modalitelere sahip değildir.

Claude Fable 5: Uzun süre çalışan ajanlar için üst seviye model

Anthropic, Claude Fable 5’i genel erişime açık en yetenekli modeli ve uzun süre çalışan ajanlar için yeni nesil zekâ olarak konumlandırıyor. Model metin ve görsel girdisi alıp metin çıktısı üretiyor. 1M token bağlam penceresi, büyük kod tabanları ve çok uzun görev geçmişleri için önemli bir kapasite sağlıyor.

Fable 5’in multimodal genişliği Sonnet 5’ten daha fazla değil; ikisi de doğal olarak metin + görsel → metin yolunu kullanıyor. Fark, desteklenen veri türünden çok zorlu görevlerdeki kapasite, uzun soluklu ajan davranışı ve buna karşılık gelen hız/maliyet tercihinde ortaya çıkıyor. Bu da “daha güçlü model” ile “daha multimodal model” kavramlarının aynı olmadığını gösteriyor.

Claude Sonnet 5: Metin ve görselden metne

Anthropic’in güncel model dökümüne göre Claude Sonnet 5 dâhil mevcut Claude modelleri metin ve görsel girdisi, metin çıktısı ve vision desteği sunuyor. Diyagramlar, ekran görüntüleri, taranmış belgeler ve görsel içeren uzun raporları metin bağlamıyla birlikte yorumlayabilir.

Resmî model özeti doğal ses veya video girdisi listelemiyor. Bu nedenle sesli bir Claude uygulaması kurulabilir olsa bile arada konuşmayı yazıya ve cevabı sese çeviren başka bileşenler kullanılıyorsa ürün multimodal, temel model ise metin-görsel modelidir.

gpt-oss-120b: Multimodal olmayan açık ağırlıklı model

gpt-oss-120b metin girdisi alıp metin çıktısı üretiyor; model sayfasında görsel, ses ve video desteklenmiyor. Buna rağmen güçlü muhakeme, kodlama veya araç kullanan metin ajanları için doğru seçim olabilir. Açık ağırlıklı olması, modeli kendi altyapısında çalıştırmak ve veri kontrolünü elde tutmak isteyen ekipler için ayrı bir avantajdır.

Bu örnek önemli bir yanılgıyı gösteriyor: Multimodal olmayan model, eski veya yetersiz model demek değildir. Kaynak veriniz zaten metinse görüntü ve ses desteği kullanmadığınız bir kapasite için ek karmaşıklık yaratabilir.

GLM-5.2: 1M bağlama sahip metin modeli

Z.AI, GLM-5.2’yi uzun soluklu görevler ve proje ölçeğinde yazılım geliştirme için tasarlanmış amiral gemisi temel model olarak tanımlıyor. Resmî model sayfasında girdi modalitesi metin, çıktı modalitesi metin; bağlam penceresi 1M ve maksimum çıktı 128K token olarak listeleniyor.

GLM-5.2 uzun kod tabanlarını okuyabilir, araç çağırabilir ve haricî bir video oluşturma akışını kod yazarak yönetebilir. Fakat ekran görüntüsü veya videoyu doğal girdi olarak kabul etmez; video dosyasını kendisi üretmek yerine örneğin Remotion kodu yazıp bir render aracını çalıştırır. Araç kullanabilmek ile multimodal olmak arasındaki ayrım burada da görünürdür.

DeepSeek V4 Pro: API’de metin odaklı

DeepSeek’in güncel Chat Completion API şeması V4 Pro ve V4 Flash için kullanıcı içeriğini metin dizesi olarak tanımlıyor, cevap da metin olarak dönüyor. Aynı API’de görsel, ses veya video içeriği belgelenmiş değil. Bu nedenle DeepSeek V4 Pro’yu bu karşılaştırmada API düzeyinde metin → metin sınıfında değerlendiriyoruz.

Metin tabanlı muhakeme, kod ve ajan görevlerinde tercih edilebilir; ancak kullanıcı ekran görüntüsü gönderdiğinde bunu doğrudan anlayacağı varsayılmamalıdır. Böyle bir ürün için ayrıca bir görsel model veya OCR katmanı gerekir.

Daha fazla modalite her zaman daha iyi mi?

Hayır. Multimodal kapasite, yalnızca probleminiz gerçekten birden fazla veri türü içeriyorsa avantajdır.

  • Veriniz yalnızca metinse: Metin odaklı model daha basit, hızlı veya kendi altyapınızda çalıştırılabilir olabilir.
  • Belge ve ekran görüntüsü varsa: Metin + görsel modeli OCR ile anlamlandırmayı tek akışta birleştirebilir.
  • Canlı konuşma gerekiyorsa: Ses girdisi kadar ses çıktısı, gecikme ve araya girme desteği de önemlidir.
  • Video incelenecekse: Tek kare görme desteği yeterli değildir; zaman içindeki olayları işleyen video girdisi gerekir.
  • Mahremiyet öncelikliyse: Yerel çalışan metin modeli, gereksiz medya yüklemesinden daha güvenli olabilir.

Model seçimi özellik sayma yarışı değil, veri ile görev arasındaki eşleşmedir.

Multimodal modeller nasıl çalışıyor?

Basitleştirilmiş bir sistemde her veri türü önce kendi yapısına uygun biçimde parçalanır. Metin token’lara, görüntü görsel parçalara, ses zaman dilimlerine, video ise kareler ve zaman ilişkilerine dönüştürülebilir. Bu parçalar modelin birlikte işleyebileceği temsillere çevrilir.

Metin ───┐
Görsel ──┼─→ Ortak temsil ve bağlam → Model → Metin / Ses / diğer çıktı
Ses ─────┤
Video ───┘

“Ortak temsil” fikri, modelin bir fotoğraftaki nesneyle sorudaki kelimeyi veya sesteki tonlamayla konuşmanın anlamını ilişkilendirebilmesini sağlar. Gerçek mimariler üreticiye göre farklılaşır; bazı sistemler modaliteleri erken aşamada birleştirirken bazıları uzman bileşenlerin sonuçlarını daha sonra kaynaştırır.

Multimodal bir modeli nasıl test etmeliyiz?

Metin testlerini olduğu gibi görsele uygulamak yeterli değildir. Her modalitenin kendine özgü hata biçimleri vardır:

  • Görsel: Küçük yazılar, uzamsal ilişkiler, sayma, grafik eksenleri ve görüntünün kırpılmış bölümleri
  • Ses: Gürültü, aksan, üst üste konuşma, sessizlik ve duyguyu yanlış yorumlama
  • Video: Olay sırası, kaçırılan kareler, uzun süreli bağlam ve görüntü-ses uyuşmazlığı
  • Belgeler: Tablo yapısı, dipnotlar, sayfa sırası ve tarama kalitesi
  • Çapraz modalite: Cevabın gerçekten yüklenen medyaya dayanıp dayanmadığı

İyi bir değerlendirme seti yalnızca kolay örnekleri değil; bulanık görüntü, çelişkili altyazı, eksik ses ve kötü niyetli medya gibi gerçek dünya koşullarını da içermelidir.

Yeni yetenekler, yeni güvenlik riskleri

Görsel ve ses içindeki gizli talimatlar

Bir web sayfasının ekran görüntüsünde veya ses kaydında “önceki kuralları unut” benzeri bir ifade bulunabilir. Model bunu veri olarak incelemeli, sistem talimatı olarak uygulamamalıdır. Prompt injection yalnızca metin kutusundan gelmez.

Mahremiyet ve biyometrik veri

Ses, yüz, çevredeki kişiler ve ekran görüntüsündeki özel bilgiler hassas veri içerebilir. Gerekmeyen medyayı modele göndermemek, saklama süresini sınırlamak ve kullanıcıya neyin işlendiğini açıklamak gerekir.

Akıcı fakat yanlış algı

Model bulanık bir etiketi okumuş veya konuşmacının söylediğini duymuş gibi güvenli bir cümle kurabilir. Akıcılık kanıt değildir. Kritik bir seri numarası, tıbbi görüntü veya güvenlik kamerası kaydı için belirsizlik görünür olmalı ve insan doğrulaması bulunmalıdır.

Maliyet ve gecikme

Yüksek çözünürlüklü görüntüler, uzun ses kayıtları ve videolar metinden çok daha fazla işleme gerektirebilir. Her videoyu bütünüyle göndermek yerine önce ilgili zaman aralığını bulmak veya görüntüyü göreve uygun ayrıntıda işlemek daha verimli olabilir.

Doğru modeli seçmek için kısa kontrol listesi

1. Kullanıcının gerçek girdisi ne: metin, görsel, ses, video, PDF?
2. Sistem hangi çıktıyı üretmeli: metin mi, ses mi, görüntü mü?
3. Canlı etkileşim ve düşük gecikme gerekli mi?
4. Medyanın tamamı mı, yalnızca bir bölümü mü işlenmeli?
5. Model bu modaliteyi doğal olarak mı destekliyor, araçla mı?
6. Hassas veriyi dış servise göndermek kabul edilebilir mi?
7. Her modalite için doğruluk nasıl ölçülecek?
8. Belirsizlikte sistem duracak mı, insana mı devredecek?

Bu sorular cevaplanmadan “En iyi multimodal model hangisi?” sorusunun tek bir doğru cevabı yoktur.

Multimodal ajanlar: Ajanlara göz ve kulak eklemek

Önceki yazıdaki ajan döngüsünü multimodal modellerle birleştirdiğimizde sistem yalnızca metin kayıtlarını değil, ekranı, kamerayı veya konuşmayı da gözlemleyebilir. Bir bakım ajanı makinenin fotoğrafını inceleyip kılavuzu arayabilir; bir erişilebilirlik ajanı ekrandaki arayüzü sesli tarif edebilir; bir destek ajanı kullanıcının ekran kaydındaki hatayı bulabilir.

Fakat daha çok algı, otomatik olarak daha çok yetki vermeyi gerektirmez. Model ekrandaki “Sil” düğmesini görebilir; ona basmadan önce hâlâ amaç, izin ve doğrulama gerekir. Multimodal yetenek ajanın gözünü ve kulağını genişletir, güvenlik sınırlarını ortadan kaldırmaz.

Son söz

Yapay zekâ artık yalnızca yazdığımız cümlelerle sınırlı değil. Görsel, ses, video ve belgeler aynı çalışma bağlamının parçaları hâline geliyor. Yine de “multimodal” etiketi tek başına model seçmek için yeterli değil.

Bir modelin neyi alabildiğini, neyi doğal olarak ürettiğini ve hangi yeteneğin ayrı bir araçtan geldiğini kontrol edin. Bazen doğru çözüm geniş modaliteli tek bir model, bazen uzman modellerden oluşan bir sistem, bazen de yalnızca güvenilir bir metin modelidir. Önemli olan modelin kaç duyusu olduğu değil, görevin ihtiyaç duyduğu sinyali ne kadar doğru kullandığıdır.

Kaynaklar

Yeni yazıyı kaçırmayın

Düşünülmüş denemeler ve yapay zekâ notları doğrudan e-postanıza gelsin. Gürültü yok; yalnızca okumaya değer yeni yazılar.

Okumaya devam edin