core-ai
Sözlük ↗Çok Modlu (Multimodal)
Çok modlu (multimodal) bir model, birden fazla veri türünü — metin artı görsel, metin artı ses veya video içeren kombinasyonları — birbirine dikilmiş ayrı özel modeller gerektirmeden, tek bir birleşik mimari içinde anlayabilen ve/veya üretebilen bir yapay zeka sistemidir. Claude, GPT-4o/GPT-5 ve Gemini gibi modern uç modeller doğal olarak çok modludur: bir e-posta yazan aynı model, bir ekran görüntüsüne bakıp bir arayüzde neyin yanlış olduğunu tarif edebilir, bir PDF'deki bir grafiği okuyup gösterdiği veriler hakkında sorulara yanıt verebilir veya bir ses klibini yazıya dökebilir ve hakkında akıl yürütebilir. Bu, SaaS geliştiricileri için önemlidir çünkü eskiden birkaç ayrı entegrasyon gerektiren şeyi (bir OCR servisi, ayrı bir görsel açıklama modeli, bir konuşmadan metne API'si ve bunları bir araya getiren bir LLM) tek bir API çağrısına indirger; bu da hem mühendislik karmaşıklığını hem de birden fazla kusurlu modeli zincirlemenin biriktirdiği hatayı azaltır. Somut bir örnek: bir gider yönetimi SaaS aracı, kullanıcının bir fişi fotoğraflamasına izin verir; görüntüyü metin çıkarmak için özel bir OCR servisinden geçirip ardından bu metni bir LLM'e beslemek yerine, tek bir çok modlu API çağrısı her ikisini de halleder — `POST /v1/messages {"model": "claude-sonnet-4.5", "messages": [{"role": "user", "content": [{"type": "image", "source": {...fiş fotoğrafı...}}, {"type": "text", "text": "Satıcı adını, tarihi ve toplamı JSON olarak çıkar."}]}]}` — model, görüntüyü hem "görebildiği" hem de içeriği hakkında tek geçişte akıl yürütebildiği için doğrudan `{"merchant": "Blue Bottle Coffee", "date": "2026-06-28", "total": 14.50}` döndürür. Çok modlu yetenek yöne göre değişir: bazı modeller yalnızca girdide çok modludur (görsel/ses okuyabilir ama yalnızca metin çıktısı verebilir), daha küçük bir set ise modlar arasında da üretim yapabilir (metinden görsele, metinden sese, metinden videoya) — genellikle tek bir modelin her şeyi yapması yerine ayrı özel modeller aracılığıyla (görseller için difüzyon modelleri gibi), ancak sektör eğilimi bunları birleştirmeye doğrudur. Geliştiriciler için çok modlu girdi yeteneği, daha önce çoklu satıcı entegrasyonu olan ürün kategorilerini — doküman işleme, görsel soru-cevap, erişilebilirlik özellikleri (görsel açıklamaları) ve ses arayüzleri — tek bir model çağrısı içinde açar. Planlamaya değer pratik bir kısıtlama: çok modlu girdi işleme, içerik türüne ve sağlayıcıya göre kalitede değişir — taranmış bir PDF'deki yoğun tabloları okumak, elle çizilmiş bir diyagramı yorumlamak veya aksanlı ya da gürültülü sesi yazıya dökmek, çok modlu yeteneği temiz, iyi biçimlendirilmiş içerikten farklı şekillerde zorlar; geliştiriciler, demo kalitesindeki performansın üretim verisine genelleşeceğini varsaymak yerine gerçek dünya girdi dağılımlarına (temiz ürün fotoğrafları değil, dağınık taranmış fişler) karşı test etmelidir.
İlgili terimler