Çin merkezli yapay zeka şirketi Deepseek, uzun belgelerin verimli biçimde işlenmesi için geliştirdiği yeni OCR (Optik Karakter Tanıma) sistemini duyurdu. Görsel tabanlı çalışan bu teknoloji, metinleri 10 kata kadar sıkıştırırken bilgilerin yüzde 97’sini koruyabiliyor.

METİNLERİ GÖRSEL OLARAK İŞLİYOR

Deepseek’in raporuna göre sistem, metinleri doğrudan değil, görüntü biçiminde analiz ediyor. Bu yöntem, işlem yükünü önemli ölçüde azaltarak büyük dil modellerinin uzun belgeleri bellek sınırına takılmadan işlemesine imkân tanıyor. Büyük dil modelleri, metinleri “token” adı verilen küçük parçalara böler. Token sayısı arttıkça hesaplama maliyeti de yükselir. Deepseek’in OCR çözümü ise içeriği piksel tabanlı olarak ele alıyor. Böylece belgeler, kelime yerine görüntü verisi üzerinden işleniyor.

İKİ ANA YAPI ÜZERİNE KURULU SİSTEM

Yeni OCR sisteminin çekirdeğini DeepEncoder ve Deepseek3B-MoE adlı iki bileşen oluşturuyor. DeepEncoder, 380 milyon parametreyle görüntü işleme görevini üstleniyor. Deepseek3B-MoE ise 570 milyon aktif parametreyle metin üretiminden sorumlu. DeepEncoder, Meta’nın SAM modeliyle OpenAI’ın CLIP modelini birleştiriyor. Aradaki 16x sıkıştırıcı sayesinde, 4.096 token’lık bir görsel 256 token’a kadar indirilebiliyor.

100 TOKEN İLE GÖREV TAMAMLANIYOR

Deepseek OCR, çözünürlüğe göre 64 ila 400 arasında “vision token” kullanıyor. Bu, klasik OCR sistemlerinin binlerce token gerektiren işlem yüküne kıyasla büyük bir avantaj sağlıyor. OmniDocBench testlerinde sistem, yalnızca 100 vision token kullanarak GOT-OCR 2.0’ı geride bıraktı. Ayrıca MinerU 2.0’ın 6.000 token gerektiren performansını da aşarak dikkat çekti.

KARMAŞIK BELGELERİ OKUYOR

Sistem, belge türüne göre farklı modlarda çalışabiliyor: Sunum belgelerinde 64 token, kitap ve raporlarda 100 token, karmaşık gazetelerde ise “Gundam modu” ile 800 token kullanıyor. Deepseek OCR yalnızca metinleri değil; diyagram, kimyasal formül ve geometrik şekilleri de tanıyabiliyor. Yaklaşık 100 dilde çalışabilen sistem, biçimlendirmeyi koruyarak hem düz metin hem de genel görsel açıklaması oluşturabiliyor.

TEK GÜNDE 33 MİLYON SAYFA İŞLEYEBİLİYOR

Modelin eğitimi, 30 milyon PDF sayfası üzerinde gerçekleştirildi. Bunların büyük kısmını İngilizce ve Çince belgeler oluşturdu. Sistem, tek bir Nvidia A100 GPU ile günde 200 bin sayfa çözümleyebilirken, 20 sunuculuk bir yapıda bu sayı 33 milyon sayfaya çıkıyor.

Bu performans, yapay zeka modellerinin eğitiminde veri üretim sürecini ciddi oranda hızlandırma potansiyeli taşıyor. Deepseek, hem kod hem de model ağırlıklarını açık erişime sunarak araştırmacıların kullanımına açtı.

Kaynak: Donanım Haber

Kaynak: Haber Merkezi