Վերադառնալ
Տեղական Qwen-ը էժան Opus չէ, այլ ուրիշ գործիք է․ OpenFaaS-ի հիմնադիրը
SiTech AI Team3 წთ. საკითხავი

Տեղական Qwen-ը էժան Opus չէ, այլ ուրիշ գործիք է․ OpenFaaS-ի հիմնադիրը

OpenFaaS-ի հիմնադիր Ալեքս Էլիսը ներկայացնում է, թե տեղական Qwen մոդելները ինչ տվեցին իր թիմին՝ գաղտնիություն և իրական խնայողություն նեղ առաջադրանքներում, բայց անվերջ ցիկլեր՝ երկար աշխատանքում։

OpenFaaS-ի, SlicerVM-ի, Actuated-ի և Inlets-ի հիմնադիր Ալեքս Էլիսը մանրամասն նկարագրել է, թե ինչպես է իր փոքր ծրագրային ընկերությունն օգտագործում տեղական լեզվական մոդելներ։ Նրա եզրակացությունը հակասում է սոցցանցերում տարածված պնդմանը․ տեղական Qwen-ը էժան Claude Opus չէ, այլ ուրիշ գործիք, որը պետք է ուղղել համապատասխան առաջադրանքներին։

Ինչ արժեց սարքավորումը

Առաջին փորձը 2023 թվականին մեկ RTX 3090 քարտն էր, որը այնքան անհարմար էր, որ փորձը դադարեցվեց։ Qwen 3.5-ը առաջին սերունդն էր, որի արդյունքներն արժեր պահել։ Այսօր աշխատանքը կատարվում է 96 GB VRAM-ով RTX 6000 Pro Blackwell-ի վրա, որը գնվել է մոտ 12 000 դոլարով․ այժմ նույն քարտն արժե մոտ 15 400 դոլար։ Երկու խելացի վարդակներ չափում են էներգիայի սպառումը․ RTX 6000 Pro-ն ինֆերենսի ընթացքում սպառում է մոտ 600 վատտ և համեմատաբար հանգիստ է, իսկ երկու 3090-ները միասին մոտենում են 750 վատտին և շատ աղմկոտ են։

Բենչմարկների տարբերությունը իրական է

Qwen 3.6 27B-ն SWE-Bench Verified-ում ստանում է 77.2 միավոր՝ Claude Opus 4.8-ի 88.6%-ի դիմաց։ Էլիսը նշում է, որ բենչմարկները շարժվող թիրախ են, որոնց համար մոդելները կարելի է կարգավորել․ SWE-Bench-ը կառուցված է Python-ի խնդիրների վրա, մինչդեռ ընկերության կոդը Go-ով է։ Առաջատար մոդելները գնահատվում են 0.5–2 տրիլիոն պարամետրով՝ սա այլ կարգի ծավալ է, քան մեկ սպառողական տեսաքարտը կարող է պահել ամբողջական որակով։ Իսկ 27B մոդելը մեկ քարտի մեջ տեղավորելու համար քվանտացումը հենց այն տեղն է, որտեղ ի հայտ է գալիս ամենավատ վարքագիծը։

Որտեղ գումարը հետ վերադարձավ

Գնումն արդարացրին երկու աշխատանքային հոսքեր։ diag գործիքը հավաքում է հաճախորդի OpenFaaS տեղադրման ամբողջական պատկերը, որը հետո վերլուծում է տեղական մոդելը ժամանակավոր VM-ում․ այսպիսով հաճախորդի տվյալները չեն հասնում ամպային մատակարարին։ Բացի այդ, հեռաչափության տվյալների բազան տեղական մոդելով անցկացնելով՝ թիմը հայտնաբերեց հաճախորդ, որը թերի էր հայտարարում լիցենզիաները և ավելի քան մեկ տարի վճարում էր չորս-հինգ անգամ ավելի քիչ․ միայն այդ գումարի վերականգնումը ծածկեց քարտի արժեքը։

Ցիկլեր, հալյուցինացիաներ և օպերացիա

Էլիսի հանդիպած հիմնական խափանումը ցիկլերն են․ երբ մոդելին խնդրեցին առաջարկել faas-cli-ի նոր հրամաններ, այն կես ժամ կրկնեց նույն հինգ առաջարկները՝ սպառելով 600 վատտ, իսկ ավտոմատ կոդ-վերանայման ժամանակ հորինեց concurrency-ի խնդիրներ և race condition-ներ, ինչով էլ փորձը դադարեց։ Մոդելի սպասարկումն ինքնին օպերացիոն խնդիր է․ ինքնություն, քվոտաներ, երթուղավորում, էներգիայի մոնիտորինգ և երկու անկախ llama.cpp ինստանս՝ ամբողջական կոնտեքստի համար։ Սպեկուլյատիվ ապակոդավորումը թողունակությունը կայուն 67-ից հասցրեց 130–200 թոքենի մեկ վայրկյանում։ Նրա խորհուրդն է՝ տեղական մոդելները թողնել սահմանափակ աշխատանքների վրա (աջակցության վերլուծություն, end-to-end թեստավորում) և երբեք չթողնել դրանք առանց հսկողության երկարաժամկետ առաջադրանքներում։ Ծախսը նույնպես իրական փաստարկ է․ ամպային կոդավորման փաթեթներն արժեն ամսական մոտ 200 դոլար, իսկ Uber-ը վերջերս սահմանափակեց աշխատակիցների AI ծախսը՝ 1500 դոլար մեկ ծրագրավորողի և մեկ գործիքի համար ամսական։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։