Վերադառնալ
Մեկամսյա GLM 5.3 Flash մարտահրավերն ավարտվեց 50% օգտագործմամբ
SiTech AI Team2 րոպե ընթերցում

Մեկամսյա GLM 5.3 Flash մարտահրավերն ավարտվեց 50% օգտագործմամբ

Մեկամսյա փորձը՝ բոլոր AI աշխատանքները GLM 5.3 Flash տեղափոխելու, ավարտվեց 50% օգտագործմամբ. 2 միլիարդ տոկենից կեսը մշակեց նպատակային մոդելը։ Բացահայտվեցին նախատիպի ծախսերը, մատակարարի սահմանափակումները և արդյունավետության չափման արժեքը։

Օգտագործման բաշխումը և նախատիպի ծախսերը

Սեպտեմբերին մեկ արդյունավետ բաց մոդելով անցկացնելու փորձը մեզ տվեց 50% օգտագործման ցուցանիշ։ 2 միլիարդ տոկենից միայն 1 միլիարդը մշակվեց GLM 5.3 Flash-ով, չնայած այն բանին, որ ամսվա առաջին կեսին նա կատարեց ամբողջ աշխատանքը։ Նրա գրանցված օգտագործումը տեղավորվեց բյուջեում՝ 68 դոլար, մոտավորապես 4 կՎտ/ժ էներգիա և 365 գրամ ածխածնի արտանետում։ Երկրորդ կեսին այլ մոդելների վրա պահանջվեց 1 միլիարդ տոկեն։

Մի անսպասելի բան կապված էր փորձարարական Wagtail MCP սերվերի հետ, որը նկարագրում էին որպես «vibe-coded» նախատիպ։ Մոդելի ընտրությունը գրեթե մեկ գիշերում ծախսեց 450 միլիոն տոկեն, 150 դոլար և 5 կՎտ/ժ էներգիա։ Սերվերը լավ աշխատեց և նաև ցույց տվեց հնարավորություններ, սակայն թիմը ենթադրում է, որ նման արդյունքի կարելի է հասնել ծախսի մեկ հինգերորդով և փոքր լրացուցիչ ջանքով։ Այս դրվագը ևս մեկ անգամ ցույց տվեց, որ փորձերի համար բյուջե է պետք, և մոդելները պետք է զգուշորեն ընտրվեն։

Ենթակառուցվածքի հասանելիությունը

Մատակարարների հասանելիությունը ևս մեկ խնդիր էր։ Թիմի օգտագործած ինֆերենս մատակարարները հաճախ աշխատում էին, սակայն հայտնի ընտրությունը չուներ խոշոր լաբորատորիաների նման հնարավորություններ։ GLM 5.3 Flash-ը ցույց տվեց արդյունավետության վատացում, հավանաբար այն պատճառով, որ թիմի աշխատանքի համար Պարետոյի ճակատում ավելի բարձր էր նստում։ Հասանելի ընտրությունը նաև սահմանափակվում էր եվրոպական տվյալների կենտրոններում հաստատված բաց մոդելներով։ Դա հանգեցրեց նման մոդելներին անցնելուն՝ DeepSeek V4.1 Flash և Qwen 3.8 Flash, ինչը պարզ փոփոխություն էր և սպասելի չէր։

Արժեքը առօրյա մշակման մեջ

Մեկ մոդելի օգտագործումը առօրյա ինժեներիայում չվերացրեց լայն ընտրանի փորձարկելու անհրաժեշտությունը։ Թիմը սկսում է մոդելների բենչմարքինգը Wagtail-ի խնդիրների վրա և կարիք ունի համեմատելի տվյալների, որպեսզի առաջարկի ավելի թեթև տարբերակներ գործակալի հմտությունների և նոր CLI նախատիպի համար, որը նպատակ ունի լավ աշխատել գործակալների հետ։

GLM 5.3 Flash-ը այնուամենայնիվ գերազանց գնահատվեց արտադրական աշխատանքի համար՝ 1 միլիոն տոկենի կոնտեքստի պատուհանի, վիզուալ աջակցության և բազմաթիվ մատակարարների մոտ հասանելիության շնորհիվ։ Այն օգտագործվում էր Wagtail-ի և դրա վրա կառուցված կայքերի վրա, ինչպես նաև UI խնդիրներում, AI հետազոտության և զարգացման մեջ, փաստաթղթերում և գնահատումներում։

Դասեր հաջորդ թեստի համար

Հոկտեմբերի համար մարտահրավերը կշարունակվի միայն առօրյա արտադրական աշխատանքում, այլ ոչ հետազոտության և զարգացման մեջ։ Ծրագրված փոփոխությունները ներառում են տոկենների օգտագործման, էներգիայի սպառման, ծախսերի և կոնկրետ արդյունքների շարունակական լոկալ հաշվետվություն։ Թիմը նաև պլանավորում է փորձերի համար հստակ բյուջեներ սահմանել, պրոմպտների ընտրությունը բարելավել, դերերի վրա հիմնված բազմագործակալ աշխատանքային հոսքեր կիրառել և արդյունավետ մոդելների փորձարկումը շարունակել։

Ավելի լայն նպատակն է, որ AI ինֆերենսի աշխատանքների մեծ մասը օգտագործի մեկ կամ երկու էժան flash-մակարդակի մոդել, իսկ առաջընթացը գնահատվի գնով կամ էներգիայի սպառմամբ, և ոչ միայն տոկենների քանակով։ Թիմը նաև կհետևի Jev-ոճի որոշումների դիֆուզիայի մոդելներին, եթե դրանք արդյունավետ աշխատեն, մինչ նոր ֆլագման մոդելները ճիշտ ուղղության քայլ են թվում։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։