
Aleph Alpha-ը թողարկեց ինքնիշխան գերմանական AI մոդել Kolibri
Գերմանական AI ընկերությունը՝ Aleph Alpha-ն, ներկայացրել է բաց կշեռքով Kolibri մոդելը: այն վերապատրաստված է միայն գերմաներեն և անգլերեն լեզուների համար և աշխատում է Գերմանիայի և Ֆինլանդիայի ենթակառուցվածքներում: Կշեռքները հրապարակվել են Apache 2.0 փատենտով:
Գերմանական AI ընկերությունը՝ Aleph Alpha-ն, 2026 թվականի հոկտեմբերի 3-ին թողարկեց բաց կշեռքով Kolibri մոդելը: Կշեռքները հրապարակվել են Apache 2.0 փատենտով Hugging Face-ում, իսկ մոդելը աշխատում է միայն գերմաներեն և անգլերեն լեզուներով: Ընկերությունը Kolibri-ն ինքնիշխան մոդել է անվանում. կազմակերպությունը կարող է այն գործարկել իր սեփական սերվերներում, տվյալները չեն դուրս գալիս շենքից, իսկ մոդելը ոչ ոք չի կարող փոխել կամ անջատել:
Ի՞նչ է Kolibri-ն
Kolibri-ն կառուցված է մասնագետների խառնուրդի (MoE) ճարտարապետության վրա և ունի ընդհանուր 78,1 միլիարդ պարամետր, սակայն յուրաքանչյուր տոկենի մշակման ժամանակ դրանցից ակտիվանում է միայն մոտ 3,5 միլիարդը: 50 շերտից յուրաքանչյուրում կա 384 մասնագետ և մեկ ընդհանուր մասնագետ, իսկ երթևեկիչը յուրաքանչյուր տոկեն ուղարկում է 384-ից միայն 6-ին: Մոդելը վերապատրաստվել է 768 NVIDIA B200 GPU-ում, մոտ 24 տրիլիոն տոկենի վրա, որոնցից 20%-ից ավելին գերմանական է:
Համատեքստի պատուհանը ընդգրկում է 262 144 տոկեն, իսկ թեստերում մոդելը հասնում է 1 048 576 տոկենի: Գիտելիքների սահմանը 2026 թվականի հունիսի 18-ն է: Կշեռքները FP8 ֆորմատում զբաղեցնում են մոտ 78 ԳԲ, ուստի անհրաժեշտ է երկու 80-գիգաբայթանոց NVIDIA A100 կամ H100, կամ մեկ H200, B200 կամ B300:
Տոկենայզերը ունի 128 000 տոկենի բառարան, և Aleph Alpha-ն ունի նոր ալգորիթմ՝ UniBPE: Ֆեդերալի սահմանադրական դատարանի անվանումը GPT-5-ի տոկենայզերի հետ համեմատած 6 տոկենով է տարբերվում, Kolibri-ի հետ՝ 2-ով: Գերմանական տեքստի համար մոդելը 11,2%-ով պակաս տոկեն է ծախսում:
Ինչու է համարվում ինքնիշխան
Ըստ Aleph Alpha-ի, մոդելը ստեղծվել է գերմանական թիմերի կողմից և վերապատրաստվել է Գերմանիայի և Ֆինլանդիայի ենթակառուցվածքներում, եվրոպական և գերմանական օրենսդրության պաշտպանությամբ, արտաքին վերահսկումից ազատ: Ընկերությունը ստորագրել է նաև Եվրոպական միության GPAI Code of Practice-ը:
Ինքնիշխանությունը չի նշանակում, որ մոդելում եվրոպայից դուրս ոչինչ չի ներխուժել. անգլերեն վեբ տեքստը մշակվել է Google-ի Gemma 4-ով, գերմաներենը՝ Mistral-NeMo-ի միջոցով, իսկ որակի ֆիլտրների համար օգտագործվել են Qwen3-32B-ի նշված տվյալները: Տվյալները նաև զտվել են քաղաքական կոնֆլիկտներից:
Ուժեղ և թույլ կողմերը
Ընկերության սեփական գնահատականով, Kolibri-ն առաջնորդում է նույն չափի բաց մոդելներին երկու լեզուներով. ընդհանուր միավորը անգլերենով 75,5 է, գերմաներենով՝ 70,8, իսկ մաթեմատիկայում (AIME 2025) գերմաներենով 87,5 և անգլերենով 96,9: Գերմանական հարցերի համար մոդելը անգլերենի անցնելու առանց գերմաներենով է մտածում: Նաև վերապատրաստվել է համոզմունքի համար. երբ համատեքստում տրված ապացույցը չի հաստատում պատասխանը, այն դա ճանաչում է: Թեստում, որտեղ պատասխանը անհայտ էր, այդպես է վարվել 44%-ը, իսկ GPT-OSS 120B-ն՝ միայն 23,7%-ով:
Թույլ կողմերը նաև հանրային են. թեստում, որտեղ պատասխանը պետք է իմանար հիշողությունից, համեմատվող 12 մոդելի միջև վերջին տեղում է, գործիքների բազմաստիճան կանչերում և կոդ գրելու խնդիրներում զիջում է մրցակիցներին: 78 ԳԲ կշիռը միայն տվյալների կենտրոնի GPU-ներում է տեղավորվում, vLLM-ի աջակցությունը նոր է, և ոչ ոք դեռ չի առաջարկում մոդելը որպես ծառայություն:
Kolibri-ն լավագույն ընտրությունն է այն դեպքում, երբ կարևոր է գերմանական տեքստը և սեփական սարքավորումները. հանրային վարչության համար, բանկի համար կամ արտադրողի համար, ով պատասխանատու է, որ փաստաթղթերը մնան ներքին ենթակառուցվածքում և վստահ սխալի դեպքում ընտրում է „չգիտեմ": Օրենքների և պայմանագրերի նման երկար փաստաթղթերի հետ աշխատելիս հենց այդ ուժեղ կողմերն են առաջանում:
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։