Վերադառնալ
Qwen3-1.7B-ի վերածումը միագլխավոր որոշումների մոդելի՝ կալիբրված հավանականություններով
SiTech AI Team2 րոպե ընթերցում

Qwen3-1.7B-ի վերածումը միագլխավոր որոշումների մոդելի՝ կալիբրված հավանականություններով

Պրակտիկ ուղեցույցը ցույց է տալիս, թե ինչպես սահմանափակել լեզվական մոդելի արտադրությունը նախապես որոշված պատասխաններով, այնուհետև գնահատել CommonsenseQA-ում և ուղղել գերակշիռ վստահության միավորները ջերմաստիճանի սանդղակավորմամբ:

Սահմանափակ դեկոդավորումը սովորաբար լեզվական մոդելին վերածում է որոշումների շարժիչի, որը մեկ անցումով ընտրում է ֆիքսված տարբերակներից՝ թողնելով ազատ տեքստի թոկեն-թոկեն գեներացիան: Qwen/Qwen3-1.7B-ում ցուցադրված մոտեցումը բառարանը կրճատում է մինչև մի քանի թույլատրված թոկեն, որպեսզի մոդելը դուրս տա միայն նախապես որոշված պատասխաններից մեկը:

Ինչպես է աշխատում միագլխավոր հատվածը

Ստանդարտ System one որոշումների մոդելները բոլոր թույլատրված պատասխանների համար կալիբրված հավանականություններ են տալիս և պատասխանում: Երբ ընդհանուր լեզվական մոդելին պահանջում են JSON արտադրել Structured Output-ի միջոցով, նրան դեռ պետք է անցնի յուրաքանչյուր գեներված թոկենի վրայով: Ցուցադրված օրինակում վերջին արտադրության համար պահանջվել է 11 անցում: Որոշումների մոդելը, ինչպիսին է Jev, թեթևացնում է ֆիքսված տարբերակների հավաքածուն, մնացածը բառարանից ծածկում է և առաջին անցումից կարդում է ամենաբարձր հավանականությամբ պատասխանը: Սա չի տալիս ճիշտ պատասխանի երաշխիք, իսկ նույնական թոկենային հավանականությունները կարող են արտահայտել հաջորդ թոկենի գերակշիռ վստահությունը, այլ ոչ թե պատասխանի ճիշտ լինելու իրական հավանականությունը:

CommonsenseQA-ի արդյունքները և գերակշիռ վստահությունը

CommonsenseQA-ի պատահական ընտրված թեստային փորձի վրա 1,7B մոդելը 1221 հարցից 725-ին ճիշտ պատասխանեց, ինչը 0,5938 ճշտություն է մակրո F1 0,5844-ով: Տվյալների հավաքածուում արագ fine-tune-ը սա բարելավեց 762-ի 1221-ից, այսինքն 0,6241 ճշտություն և մակրո F1 0,6234: Խնդիրը առաջացան անորոշ հարցերի վրա: Երբ հարցրին, թե որտեղ կգտներ ամենահավանականը չղջիկը կամ բեյսբոլի գնդակը, տարբերակներով՝ քարանձավ, բեյսբոլի խաղ, այլ, կենդանաբանական այգի և սպորտային կենդանիների խանութ, մոդելն ընտրեց քարանձավը 0,9978 հավանականությամբ, չնայած որ հաստատուն պատասխան գոյություն չուներ: Բիներով բաժանված գնահատումը հաստատեց գերակշիռ վստահությունը. 0,90-ից 1,00 վստահության բինում, որտեղ կար 809 փորձ, ճշտությունը միայն 0,7009 էր, իսկ 0,80-ից 0,90 բինում՝ 121 փորձով, այն իջավ մինչև 0,4711:

Կալիբրում ջերմաստիճանի սանդղակավորմամբ

Վստահության ճշտությանը համապատասխանեցնելու համար հեղինակը օգտագործեց ջերմաստիճանի սանդղակավորում և ջերմաստիճանի պարամետրը համապատասխանեցնեց մոդելի ճշտությանը մոտեցնելու գծով: Մոտեցված արժեքը եղել է 3,797280788421631: Սանդղակավորումից հետո բիներով բաժանված վստահությունը շատ ավելի մոտ եկավ չափված ճշտությանը. վերին բինը ցույց տվեց 0,9333 վստահություն՝ համեմատելով 0,9541 ճշտության հետ, իսկ միջանկյալ բիները մի քանի տոկոսային կետով մոտ էին չափված ճշտությանը: Հեղինակը հրապարակեց GitHub պահեստը սկրիպտներով՝ տվյալների հավաքածուն կազմելու, մոդելը գնահատելու, հատուցելու և կալիբրելու համար, և կոչ է անում բոլորին փորձել աշխատանքային գործընթացը նաև ավելի մեծ մոդելների վրա:

Աղբյուրներ: nishtahir.com

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։