
Լոկալ մոդելներն այժմ իսկապես լավն են. ինժեների փորձը 2022-ի Mac-ի վրա
Ինժեներ Վիքի Բոյկիսը գրում է, որ լոկալ մոդելները վերջապես բավական լավ են դարձել ագենտային կոդավորման համար. 64 GB հիշողությամբ 2022-ի M2 Mac-ի վրա դրանք հասնում են ֆրոնտիեր մոդելների ճշգրտության և արագության մոտ 75%-ին։
Ինժեներ Վիքի Բոյկիսը լոկալ մոդելների հետ աշխատում է դրանց ի հայտ գալուց ի վեր, և 2026 թվականի հունիսի 15-ի գրառման մեջ ամփոփում է՝ վերջապես դրանք իսկապես լավն են։ Նրա փորձարկման մեքենան 2022 թվականի M2 Mac-ն է՝ 64 GB օպերատիվ հիշողությամբ և 1 TB պահուստով։
Նա փորձարկել է Mistral 7B, Gemma 3, OpenAI OSS-20B, Qwen 3 MoE և Qwen-ի այլ տարբերակներ, այդ թվում՝ Qwen 2.5 Coder, տարբեր միջավայրերում՝ մաքուր llama.cpp՝ Open WebUI-ով, llama-cpp-python, Ollama, llamafiles և LM Studio։
Որտեղ են լոկալ մոդելները հիմա
Բեկումնային պահը, ըստ հեղինակի, GPT-OSS-ի թողարկումն էր՝ առաջին մոդելը, որի պատասխանները նա այլևս հաճախ չէր ստուգում API-մոդելի հետ։ Նրա անձնական չափանիշը պարզ է՝ պե՞տք է սա համեմատել API-մոդելի հետ։
Gemma 4 ընտանիքի վերջին թողարկումներով նա վերջապես սկսեց ագենտային կոդավորում կատարել լոկալ՝ ցիկլերը աշխատում են ֆրոնտիեր մոդելների ճշգրտության և արագության մոտավորապես 75%-ով։ Նրա լռելյայն լոկալ մոդելը LM Studio-ում gemma-4-26b-a4b-ն է։ Դրա օգնությամբ նա notebook-ի սկրիպտը վերածեց հինգ-վեց մոդուլից բաղկացած պահոցի, ուղղեց տիպերի հուշումները, սրբագրեց բլոգի գրառումները, գրեց unit-թեստեր և զրոյից կառուցեց two-tower առաջարկությունների մոդելի պահոց։ K-V քեշը հասնում է 64 GB-ի, և այդ առաջադրանքները կես տարի առաջ լոկալ մոդելների համար անհնար էին։
Ինչպես գործարկել լոկալ ագենտներն այսօր
Պետք է երեք բաղադրիչ՝ լոկալ inference շարժիչ, ագենտային շրջանակ (harness) և մոդելի ֆայլ, որին շրջանակը ցույց է տալիս լոկալ հասցեով։ Բոյկիսը որպես շրջանակ օգտագործում է Pi-ն, իսկ որպես inference սերվեր՝ LM Studio-ն՝ նշելով, որ ուղիղ llama.cpp-ն հավանաբար ավելի արագ կլիներ։
Անվտանգության համար Pi-ի յուրաքանչյուր սեսիա աշխատում է Docker կոնտեյներում և ունի միայն bash-ի թույլտվություն, այնպես որ չի կարող գործարկել Python կոդ կամ զննել համացանցը։ Որպես մոդել նա ընտրել է gemma-4-12b-qat-ը՝ ավելի նոր, փոքր և արագ, ճշգրտության փոքր կորստով։
Ինչը դեռ չի աշխատում
Inference-ը կարող է դանդաղ լինել, կոնտեքստի պատուհանները փոքր են և սահմանափակված սեփական սարքավորումով, իսկ վաղ թողարկումները տառապում են prompt-ի ձևանմուշների անհամապատասխանությունից, թեև դրանք արագ ուղղվում են։ Էկոհամակարգը շատ ավելի հեշտացել է LM Studio-ի և HuggingFace-ի Use This Model կոճակի շնորհիվ։
Ըստ հեղինակի՝ սա դեռ պատրաստ չէ արտադրական ծրագրային մշակման համար։ Փոխարենը առավելությունը թափանցիկությունն է՝ կարելի է իրական ժամանակում դիտել թոքենների գեներացումը, փոխել կոնտեքստի պատուհանը, համակարգային prompt-ը և քվանտացումը, ինչպես նաև մոդելները մրցեցնել միմյանց դեմ։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։