Վերադառնալ
Liquid AI-ը թողարկել է DSpark դրաֆտ մոդելը տեսա-լեզվական մոդելների արագացման համար
SiTech AI Team2 წთ. საკითხავი

Liquid AI-ը թողարկել է DSpark դրաֆտ մոդելը տեսա-լեզվական մոդելների արագացման համար

Liquid AI-ը ներկայացրել է փորձարարական DSpark դրաֆտ մոդելը տեսա-լեզվական LFM2.5-VL-3B մոդելի համար։ Սպեկուլյատիվ ապակոդավորումը սարքում արագացնում է մինչև 3,13 անգամ, H100-ում՝ 2,66 անգամ, առանց ելքի որակի փոփոխության։

Liquid AI-ը սեպտեմբերի 24-ին ներկայացրել է փորձարարական DSpark դրաֆտ մոդելը տեսա-լեզվական LFM2.5-VL-3B մոդելի համար։ Այն ավելացնում է սպեկուլյատիվ ապակոդավորման ուղի. հիշողության փոքր աճի դիմաց՝ զգալի արագացում՝ առանց ելքի որակը փոխելու։

Ինչ է տալիս դրաֆտ մոդելը

Liquid AI-ի չափումներով՝ ապակոդավորումը սարքում արագանում է մինչև 3,13 անգամ, իսկ H100-ում՝ 2,66 անգամ, ծայրից ծայր ուշացումը նվազում է 2,62 և 2,27 անգամ։ Դրաֆտերը թիրախ մոդելին ավելացնում է 280 միլիոն պարամետր՝ 3B մոդելի 8,9%-ը, իսկ llama.cpp-ի, MLX-VLM-ի և SGLang-ի աջակցությունը կա առաջին իսկ օրվանից։

Ինչպես է աշխատում սպեկուլյատիվ ապակոդավորումը

Տեսային դրաֆտերն օգտագործում է նույն ճարտարապետությունը, ինչ տեքստային LFM2.5-DSpark մոդելները. կարդում է թիրախ մոդելի թաքնված վիճակները սահմանված շերտերում և դրանց հիման վրա առաջարկում k թոքենների բլոկ։ Պատկերի հատվածներն ու տեքստային թոքենները վերածվում են ընդհանուր ներկայացման, ուստի դրաֆտերն աշխատում է միևնույն չափողականության վեկտորների հետ։

DSpark դրաֆտերի ճարտարապետության սխեման

Ուսուցումը ընթացել է DSpark-ի բաղադրատոմսով՝ տեսա-լեզվական SFT տվյալների հիման վրա. 3, 4 և 5 շերտերի համեմատությունից հետո ընտրվել է դրաֆտեր՝ 4 շերտով, որը հիմնվում է միայն ուշադրության մեխանիզմի վրա, բլոկի չափը՝ 9։ Դրաֆտերն ունի մոտ 279,5 միլիոն պարամետր։

Արագացումը սարքում և H100-ում

Չափումները կատարվել են 8 բլոկի չափով և MMSpec չափանիշով վեց տեսային առաջադրանքներում։ M5 Max-ում MLX-ով ապակոդավորումը արագացել է 2,30-ից 3,13 անգամ, իսկ ուշացումը նվազել է 1,56-ից 2,62 անգամ։ M3 Ultra-ում llama.cpp-ով ապակոդավորումը բարելավվել է 1,57-ից 2,14 անգամ, իսկ ընդհանուր ժամանակը՝ 1,30-ից 1,77 անգամ։ H100-ում ապակոդավորումն արագանում է մինչև 2,66 անգամ, իսկ ուշացումը նվազում է 1,64-ից 2,27 անգամ։

Ապակոդավորման արագացումը սարքում

Որտեղ սպեկուլյացիան դադարում է օգնել

Սպեկուլյատիվ ապակոդավորումը արագացնում է միայն ապակոդավորումը, ոչ պատկերի կոդավորումը կամ նախնական լրացումը։ Պատկերը սկզբում անցնում է տեսային կոդավորիչով, ապա լեզվական հիմքը միասին մշակում է հարյուրավոր տեսային թոքեններ և տեքստային հարցումը, իսկ սահմանային սարքերում այդ փուլը զբաղեցնում է ուշացման մեծ մասը։ Երբ այդ փուլերն արդեն ծախսում են ժամանակի զգալի մասը, նույնիսկ մեծ արագացումը տալիս է միայն չափավոր շահույթ։ Liquid AI-ը դա բացատրում է Ամդալի օրենքով։

Դրաֆտերը հասանելի է Hugging Face-ում Safetensors և GGUF ձևաչափերով. անհրաժեշտ են llama.cpp-ի, MLX-VLM-ի և SGLang-ի այն տարբերակները, որոնք աջակցում են DSpark-ին։ Սպեկուլյատիվ ապակոդավորումը ճշգրիտ է. թիրախ մոդելը ստուգում է յուրաքանչյուր թոքեն, ուստի greedy ռեժիմում արդյունքը համընկնում է թիրախ մոդելի ելքի հետ։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։