BAE’den yapay zekâda yeni teknoloji hamlesi! Abu Dabi’nin İleri Teknoloji Araştırma Konseyi’nin (ATRC) uygulamalı araştırma kolu olan Teknoloji İnovasyon Enstitüsü (TII), Meta’nın SAM3 ve Alibaba’nın Qwen modelleri de dahil olmak üzere önde gelen küresel sistemlerle rekabet eden ve çok daha verimli çalışan Falcon Perception adlı yeni nesil çok modlu bir yapay zeka modelini tanıttı.
BAE’den yapay zekâda yeni teknoloji hamlesi!
Yapay zekadaki küresel rekabetin artması ve ülkelerin dil, görme ve robotik alanlarında egemen yetenekler geliştirme yarışında olduğu bir dönemde Falcon Perception, BAE’yi gelişmiş çok modlu modelleri ölçekli olarak geliştiren birkaç ülkeden biri haline getiriyor. Yaklaşık 600 milyon parametreye sahip olan Falcon Perception, nesne segmentasyonu, yoğun görsel anlama ve belge zekasında rekabetçi performans sunuyor, çok daha büyük sistemlerle eşleşiyor veya onlara yaklaşıyor ve tipik olarak çok modlu yapay zekayla ilişkili hesaplama taleplerini azaltıyor.

Multimodal AI sistemleri, resim ve metin gibi birden fazla bilgi türünü aynı anda işleyip anlayabilir. En yaygın bilinen AI sistemleri genellikle dil üzerine odaklanırken, AI’daki bir sonraki yenilik dalgası algıda yatıyor, makinelerin fiziksel dünyayı yorumlayıp ona göre hareket etmesini sağlıyor. Resim ve dil anlayışını tek bir sistemde birleştirerek, Falcon Perception AI sistemlerinin resimleri yorumlamasını, nesneleri tanımasını ve metinleri okumasını sağlıyor, makineleri insanlara benzer şekilde fiziksel dünyayı anlamaya yaklaştırıyor.

TII’nin en yeni modeli, aynı anda yüzlerce nesne içeren resimleri işleyebiliyor ve yoğun ortamlarda doğru algılamayı halüsinasyon veya mimari sınırlamalar olmadan mümkün kılıyor. AI robotik, ileri üretim, otonom platformlar ve akıllı altyapı alanlarına genişledikçe, bu birleşik görme ve dil yeteneği önemli hale geliyor.
Günümüzdeki multimodal yapay zeka ilerlemesinin çoğu, hiperskala altyapısı gerektiren giderek daha büyük modellerle sağlanıyor. Aynı zamanda birçok görsel-dil sistemi, ayrı bileşenlere dayanıyor: görüntüleri işleyen bir model ve onları dil yoluyla yorumlayan bir başka model. Bu katmanlı yaklaşım mimari karmaşıklığı artırıyor ve hesaplama yükünü yükseltiyor. Hesaplama kullanılabilirliği, gecikme, güvenlik ve maliyet gibi sıkı sınırlamalar altında çalışan endüstriyel ve kurumsal ortamlar için bu tür gereksinimler pratik uygulamayı sınırlayabilir.
ile ilgili:Google ‘Gemini’ ve yapay zekasını bir Türk mühendisin eline teslim ediyor


