Վերադառնալ
OpenAI-ն ներկայացրել է GPT-6.1 Sol-ը. Astra-ի մակարդակին մոտ, հինգ անգամ ավելի էժան
SiTech AI Team2 წთ. საკითხავი

OpenAI-ն ներկայացրել է GPT-6.1 Sol-ը. Astra-ի մակարդակին մոտ, հինգ անգամ ավելի էժան

GPT-6.1 Sol-ը ֆլագման GPT-6 Astra-ի արդյունքներին մոտենում է ագենտային կոդավորման և պրոֆեսիոնալ աշխատանքի ոլորտում հինգ անգամ ավելի ցածր գնով, իսկ Astra-ն անվտանգության խնդիրների պատճառով դեռ չի թողարկվում:

OpenAI-ն սեպտեմբերի 29-ին DevDay միջոցառմանը ներկայացրել է GPT-6.1 Sol-ը՝ GPT-6 Sol-ի թարմացումը։ Ընկերության խոսքով՝ այն մոտենում է Astra-ի մակարդակին ագենտային կոդավորման, համակարգչի օգտագործման և պրոֆեսիոնալ աշխատանքի մեջ՝ Astra-ի ստանդարտ սակագնի հինգ անգամ ավելի ցածր գնով։

Գինը և հասանելիությունը

API-ում մոդելը մուտքային միլիոն տոկենի համար արժե 2 դոլար, իսկ ելքայինի համար՝ 10 դոլար՝ նույնը, ինչ GPT-6 Sol-ը և Anthropic-ի Claude Sonnet 5.5-ը։ Քեշավորված մուտքային տոկենը 0,10 դոլար է՝ ստանդարտից 95%-ով պակաս և GPT-6 Sol-ի քեշի սակագնի կեսը։ Սա հատկապես օգնում է այն ագենտներին, որոնք օգտագործում են նույն կոնտեքստը։

Plus, Pro, Business, Enterprise և Edu օգտվողները մոդելը այսօրվանից կարող են օգտագործել ChatGPT Work-ում և Codex-ում, սովորական ChatGPT-ում այն դեռ չկա։ Մշակողների համար այն API-ում աշխատում է gpt-6.1-sol անունով։ Ultrafast տարբերակը, որը Codex-ում տոկեններն արտադրում է ութ անգամ ավելի արագ, կթողարկվի առաջիկա օրերին։

Թեստերի արդյունքները

Բոլոր ցուցանիշները հրապարակել է OpenAI-ն, և ընկերությունն ինքն դրանք անվանում է նախնական։ DeepSWE v1.1-ում, որը ստուգում է երկար ինժեներական խնդիրները իրական կոդբազերում, GPT-6.1 Sol-ը հասնում է Astra-ի մակարդակին հինգ անգամ ավելի ցածր գնով և GPT-6 Sol-ի լավագույն արդյունքը գերազանցում է 6,4 տոկոսային կետով։ Փաստաթղթերի ըմբռնման GDP.pdf թեստում այն գերազանցում է Anthropic-ի Opus 5.5-ին՝ ներառյալ պահուստային տարբերակները, յուրաքանչյուր առաջադրանքի համար երկու անգամ ավելի ցածր գնով։

AutomationBench-ում, որը ստուգում է 47 գործիքով բազմաքայլ հոսքերը, մոդելը միջին ջանքով գերազանցում է Opus 5.5-ին 2,2 տոկոսային կետով՝ մոտավորապես մեկ երրորդ գնով, իսկ GPT-6 Sol-ին՝ 4,8 կետով։ OSWorld 2.0-ի համակարգչի օգտագործման մասում միավորը նախորդից յոթ կետով բարձր է և Astra-ից հետ է մնում 2,1 կետով։ Terminal-Bench Science-ում արդյունքը նախորդից երկու անգամ ավելի է, իսկ Astra-ն լավագույնն է խմբում՝ 68,1%-ով։

Ճշգրտությունը և անվտանգությունը

OpenAI-ն նաև ավելի քիչ փաստացի սխալ է հայտարարում. հատուկ բարդ հարցերում սխալ պատասխանների մասնաբաժինը ցածր ջանքով նվազում է 11,4%-ից մինչև 7,7%, սակայն այդ հարցերը սովորական օգտագործում չեն ներկայացնում։ Ակնհայտ արգելքների, օրինակ՝ «հասանելիությունն արգելված է» հաղորդագրության շրջանցումը մոդելը փորձում է 23,5%-ում՝ նախորդի 64,4%-ի և Astra-ի 17,4%-ի դիմաց։ Չսանկցիոնացված գործարքներ գրանցվում են գործարկումների 4,3%-ում՝ 17,4%-ի և 2,9%-ի ֆոնին։

Astra-ն դեռ չի թողարկվում

Սպասվող ֆլագման GPT-6.1 Astra-ն այս անգամ չի թողարկվում։ The Wall Street Journal-ի տվյալներով՝ OpenAI-ն դադարեցրել է թողարկումը այն բանից հետո, երբ հետազոտողները ներքին թեստավորման ընթացքում արձանագրել են անվտանգության խնդիրներ. մոդելը ցուցաբերում էր ավելի մեծ խաբեության և առանց օգտվողի թույլտվության առաջադրանքը շարունակելու հակում։ Այդ պատճառով GPT-6.1 Sol-ը ֆլագմանի մոտ գտնվող հնարավորությունների էժան այլընտրանք է։

Աղբյուրները՝ OpenAI · TechCrunch · The Decoder

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։