
Ember-1 և Kimi K3՝ գրեթե նույն արդյունք, 3,4 անգամ ավելի բարձր արագություն
Fireworks Research-ը սեպտեմբերի 23-ին ներկայացրեց Ember-1-ը, որը կառուցված է Kimi K3-ի հիման վրա։ Անկախ թեստերում երկու մոդելներն էլ ցույց տվեցին գրեթե նույնական ճշգրտություն, իսկ Ember-1-ը պարզվեց 3,4 անգամ ավելի արագ։
Fireworks Research-ը սեպտեմբերի 23-ին որպես հետազոտական թողարկում ներկայացրեց Ember-1 մոդելը, որը կառուցված է Moonshot-ի բաց կշիռներով Kimi K3 մոդելի վրա։ Ընկերության պնդմամբ՝ նոր մոդելը Kimi K3-ի որակին հասնում է մոտավորապես 40%-ով ավելի քիչ token-ով։ «Այն սովորել է նվազեցնել ավելորդ դատողությունը՝ պահպանելով անհրաժեշտ մտածողությունը», հայտարարում է Fireworks Research-ը։ Դատողության token-ները հաշվարկվում են output-ի սակագնով, ուստի ավելի քիչ մտածելը ավելի էժան է։
OpenRouter-ում Ember-1-ի գինը մեկ միլիոն input token-ի համար 3 դոլար է, output token-ի համար՝ 15 դոլար։ Fireworks-ը նույնն է պահանջում նաև Kimi K3-ի համար, սակայն այլ պրովայդերներ Kimi-ն վաճառում են մեկ միլիոն input token-ի համար 1 դոլարով և output token-ի համար 9 դոլարով։
Ինչպես անցկացվեց թեստավորումը
The New Stack պարբերականը երկու մոդելներն էլ OpenRouter-ի միջով, նույն հարցումներով և լռելյայն պարամետրերով գործարկեց և արդար համեմատության համար երկուսն էլ վերահասցեավորեց Fireworks-ին։ Յուրաքանչյուր թեստ կատարվեց հինգ անգամ, իսկ դատողության token-ները գրանցվեցին մնացած output-ից առանձին։
Երեք տիպի առաջադրանքներ աստիճանաբար բարդանում էին՝ տրամաբանական գլուխկոտրուկներ 4, 5 և 7 ինժեներով; գործարկման ժամանակացույց 12 ծառայությամբ, կախվածություններով, երկու «բլեքաութի» պատուհանով և 17-ժամյա օպտիմալ պլանով; և հավանականության հինգ հարց՝ կրկնվող հարցումների համակարգի վերաբերյալ, որտեղ պատասխանները ճշգրիտ կոտորակներ են։ Պատասխանները ստուգվեցին երկու անկախ մեթոդով։
Արդյունքներ
Տրամաբանական գլուխկոտրուկներում երկու մոդելներն էլ բոլոր երեք առաջադրանքները հինգ գործարկումներից յուրաքանչյուրում ճիշտ լուծեցին։ Ember-1-ին միջինում պահանջվեց 13 630 դատողության token, 3 րոպե 46 վայրկյան և 0,27 դոլար, իսկ Kimi K3-ին՝ 16 679 token, 12 րոպե 26 վայրկյան և 0,34 դոլար։ Սա 18%-ով ավելի քիչ դատողության token է։ Kimi K3-ի ամենադանդաղ գործարկումը տևեց գրեթե 20 րոպե։
Գործարկման ժամանակացույցում երկուսն էլ գտան 17-ժամյա պլան, և բոլոր պլանները անցան ստուգող թեստը։ Ember-1-ին պահանջվեց 6 543 token և 1 րոպե 29 վայրկյան, Kimi K3-ին՝ 7 792 token և 4 րոպե 46 վայրկյան։ Հավանականության թեստում գրանցվեց միակ սխալը. Kimi K3-ը բոլոր պատասխանները ճիշտ տվեց բոլոր հինգ գործարկումներում, իսկ Ember-1-ը՝ միայն չորսում։ Հինգերորդում փոքր թվաբանական սխալ թույլ տվեց՝ 0,94629-ի փոխարեն գրեց 0,94619, և այդ թերությունը տարածվեց նաև երկու այլ պատասխանների վրա։
Ընդհանուր առմամբ Kimi K3-ը կատարեց 15-ից 15 գործարկում առանց սխալի, Ember-1-ը՝ 15-ից 14։ Fireworks-ի սակագներով թեստերի ընդհանուր արժեքը Ember-1-ի համար 2,48 դոլար էր, Kimi K3-ի համար՝ 3,26 դոլար, այսինքն Ember-1-ը մոտավորապես 24%-ով ավելի էժան է։ Սակայն Kimi K3-ի գինը կախված է պրովայդերից. նվազագույն սակագնով նույն թեստերը կարժենային 1,96 դոլար՝ ավելի քիչ, քան Ember-1-ը։
Ինչ է սա նշանակում գործնականում
Մարքեթինգային նյութերում չէր նշվում այն փաստը, որ Ember-1-ը թեստերի յուրաքանչյուր հավաքածու ավարտում էր Kimi K3-ից 3,4 անգամ ավելի արագ, իսկ դատողության token-ները ընդհանուր առմամբ 23%-ով ավելի քիչ էր ծախսում։ Հեղինակի եզրակացությամբ՝ ճշգրտությամբ երկու մոդելները նույն մակարդակում են։ Նրանց, ովքեր ուզում են գրեթե նույնական արդյունք ստանալ հնարավորինս արագ, ավելի լավ է Ember-1-ը. նրանց, ովքեր գինը գլխավոր են համարում, ավելի էժան պրովայդերին վերահասցեավորած Kimi K3-ն ավելի էժան է ստացվում։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։