Վերադառնալ
Մեկ Python ֆունկցիա՝ Jev-ի նման փաթաթիչ LLM-ների և տեսողական մոդելների համար
SiTech AI Team2 წთ. საკითხავი

Մեկ Python ֆունկցիա՝ Jev-ի նման փաթաթիչ LLM-ների և տեսողական մոդելների համար

2026 թվականի սեպտեմբերին հրապարակված գրառման մեջ հեղինակը ցույց է տալիս մեկ Python ֆունկցիա, որը մի քանի LLM մատակարարների, այդ թվում տեսողական մոդելների, դարձնում է միասնական կանչի ինտերֆեյս՝ հավանականությամբ գնահատված պատասխաններով։

2026 թվականի սեպտեմբերին հրապարակված գրառման մեջ հեղինակը նկարագրում է մեկ Python ֆունկցիա, որը մի քանի LLM մատակարարների, այդ թվում տեսողական մոդելների, դարձնում է միասնական կանչի ինտերֆեյս։ Ըստ նրա՝ գաղափարը ծնվել է Jev-ին և նրա շուրջ ստեղծված ինքնահոսթավոր պրոեկտներին՝ OpenJev-ին ու SemIf-ին ծանոթանալուց, ինչը նրան բացահայտեց token-ների հավանականությունները կարդալու հնարքը։

Ինչ է նշանակում «Jev-ի նման»

Jev-ի փաստաթղթավորված հարցման ձևաչափը JSON փաստաթուղթ է՝ տեքստային վիճակով և հարցերի հավաքածուով։ Հեղինակի փաթաթիչը պահպանում է այդ կառուցվածքը, բայց ավելացնում է նկարների համար իր սեփական attachments դաշտը, որը պաշտոնական ձևաչափը չի ընդգրկում։ Այսինքն «Jev-ի նման» արտահայտությունն այստեղ վերաբերում է հարցում-պատասխանի կառուցվածքին, ոչ թե պրոեկտին։

Ինչպես է աշխատում փաթաթիչը

Ամեն հարց վերաշարադրվում է A-ից T տառերով նշված տարբերակներով հուշման և ուղարկվում սովորական HTTP հարցումով։ Մոդելը ստիպված է արտադրել միայն մեկ token, փոխարենը API-ն վերադարձնում է տառերը՝ իրենց լոգարիթմական հավանականությունների հետ։ Այդ թվերը դառնում են հավանականություններ, որոնցից էլ ստացվում է պատասխանը։ choice տիպի հարցում հաղթում է ամենաբարձր հավանականությամբ տարբերակը, noul (այո/ոչ) տիպը վերադարձնում է true-ի հավանականությունը, իսկ score-ը՝ չափանիշների միջև սպասվող մակարդակը։ Ամեն հարց ընդունում է 2-ից 20 տարբերակ։ եթե մատակարարը բաց է թողնում անտեսելի չափով տարբերակ, ֆունկցիան սխալ է վերադարձնում՝ գուշակելու փոխարեն։

Մատակարարներ, նկարներ և արագություն

Օրինակը լռելյայն դիմում է տեղական llama.cpp սերվերին, իսկ բանալու առկայության դեպքում՝ OpenAI-ին։ API բանալին ուղարկվում է միայն api.openai.com-ին։ llama.cpp-ն լոգարիթմական հավանականությունների համար պահանջում է Chat Completions, իսկ OpenAI-ն՝ Responses՝ բավարար այլընտրանքներ ցույց տալու համար, և սկրիպտը ինքն է լուծում այդ տարբերությունը։ Նկարները փոխանցվում են base64 data URL-ի տեսքով, ուստի նույն հարցերը կարելի է տալ նաև վեբ-տեսախցիկի կադրին։ Դեմոյում հեղինակը կադրերը կարդում է OpenCV-ով, որը ծառայում է միայն տեսախցիկին հասանելիությանը, և տպում է պատասխանների աղյուսակ։ RTX 3090-ի վրա Gemma 4 12B-ով, կադրին երեք հարցով, ստացվում է մոտ մեկ կադր վայրկյանում։ gpt-6-luna-ի API-ով՝ մոտ 0,2 կադր վայրկյանում։

Ինչի վրա է ուշադրություն դարձնում հեղինակը

Հեղինակը բացահայտ ասում է, որ մասնագիտացված համակարգչային տեսողության մոդելները շատ ավելի արդյունավետ են, իսկ իր մոտեցման արժեքը ճկունությունն է՝ նոր պայման ավելացվում է սովորական տեքստով նկարագրելով։ Նա նաև նշում է, որ մուտքային տվյալների մշակումը դեռ ժամանակ է պահանջում, ընդհանուր վիճակի նախածանցը քեշավորվում է բեքենդի աջակցության դեպքում, իսկ արագության ցուցանիշները ստացվել են չօպտիմիզացված կարգավորումից, որտեղ ամեն հարց ու կադր ունի առանձին կապ։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։