Geri Dön
Liquid AI, görsel-dil modellerini hızlandıran DSpark drafter'ını yayınladı
SiTech AI Team2 წთ. საკითხავი

Liquid AI, görsel-dil modellerini hızlandıran DSpark drafter'ını yayınladı

Liquid AI, LFM2.5-VL-3B görsel-dil modeli için deneysel DSpark drafter modelini yayınladı: spekülatif kod çözme cihazda 3,13 kata, H100'de ise 2,66 kata kadar hızlanma sağlıyor ve çıktı kalitesini değiştirmiyor.

Liquid AI, 24 Eylül'de görsel-dil modeli LFM2.5-VL-3B için deneysel DSpark drafter modelini yayınladı. Model, küçük bir bellek artışına karşılık belirgin hızlanma sağlayan spekülatif kod çözme yolu ekliyor; çıktı kalitesi değişmiyor.

Drafter ne kazandırıyor

Liquid AI'nın ölçümlerine göre kod çözme cihazda 3,13 kata, H100'de ise 2,66 kata kadar hızlanıyor; uçtan uca gecikme 2,62 ve 2,27 kata kadar azalıyor. Drafter hedef modele 280 milyon parametre, yani 3B modelin üzerine %8,9 ekliyor; llama.cpp, MLX-VLM ve SGLang desteği ilk günden hazır.

Görsel modellerde spekülatif kod çözme nasıl çalışır

Görsel drafter, metin tabanlı LFM2.5-DSpark modelleriyle aynı mimariyi kullanıyor: hedef modelin gizli durumlarını belirli katmanlarda okuyup k adet aday token içeren bir blok öneriyor. Görüntü parçaları ile metin token'ları ortak gösterime yansıtılıyor, böylece drafter girdi türünden bağımsız olarak aynı boyutlu vektörlerle çalışıyor.

Görsel-dil modeli için DSpark drafter mimarisi

Eğitim, DSpark tarifine göre görsel-dil SFT verileri üzerinde yapıldı: 3, 4 ve 5 katmanlı sürümlerin ardından dikkat mekanizmasına dayanan 4 katmanlı sade bir drafter ve 9'luk blok boyutu seçildi. Drafter toplamda yaklaşık 279,5 milyon parametre içeriyor.

Cihazda ve H100'de hızlanma

Ölçümler 8'lik blok boyutuyla, MMSpec ölçütüne göre altı görsel görevde yapıldı. M5 Max üzerinde MLX ile kod çözme 2,30 ile 3,13 kat arasında hızlandı, uçtan uca gecikme 1,56 ile 2,62 kat arasında iyileşti. M3 Ultra üzerinde llama.cpp ile kod çözme 1,57 ile 2,14 kat, uçtan uca süre ise 1,30 ile 1,77 kat iyileşti. H100'de kod çözme 2,66 kata kadar hızlanıyor, uçtan uca gecikme 1,64 ile 2,27 kat arasında azalıyor.

Cihazda kod çözme hızlanması

Spekülasyonun işe yaramadığı yer

Spekülatif kod çözme yalnızca kod çözmeyi hızlandırır; görüntü kodlamayı veya ön doldurmayı hızlandırmaz. Görüntü önce görüntü kodlayıcıdan geçer, ardından dil omurgası yüzlerce görsel token'ı istemle birlikte işler; uç cihazlarda bu aşama sürenin büyük bölümünü kaplar. Bu aşamalar zamanın önemli kısmını zaten tüketiyorsa, kod çözmedeki büyük hızlanma bile uçtan uca ölçülü bir kazanç sağlar. Liquid AI bunu Amdahl yasası olarak açıklıyor.

Drafter, Hugging Face üzerinde Safetensors ve GGUF formatlarında sunuluyor; llama.cpp, MLX-VLM ve SGLang için DSpark desteği olan sürümler gerekiyor. Spekülatif kod çözme birebir sonuç veriyor: hedef model önerilen her token'ı doğruluyor, dolayısıyla açgözlü modda çıktı hedef modelin tek başına ürettiğiyle aynı oluyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.