
Desert Ant Labs-ը թողարկել է 18 սարքային ԱԲ մոդել՝ մեկ SDK-ով
Եվրոպական լաբորատորիան ներկայացրել է աուդիոյի, տեսողության և տեքստի 12 կայուն ու 6 բետա մոդել, որոնք աշխատում են սարքում և անվճար են մինչև 100 000 ակտիվ սարք ամսական։
Եվրոպական ԱԲ լաբորատորիա Desert Ant Labs-ը 2026 թ. սեպտեմբերի 8-ին թողարկել է աուդիոյի, տեսողության և տեքստի՝ սարքում աշխատող տասնութ մասնագիտացված մոդել, Swift-, Kotlin- և JavaScript-ի մեկ SDK և գնային մոդել, որի դեպքում լոկալ ինֆերենսը անվճար է։
Մեկ մոդել՝ մեկ խնդրի համար
Մոդելներից տասներկուսը կայուն են, վեցը՝ բետա։ Յուրաքանչյուրը պատասխանում է միլիվայրկյաններում և ոչինչ չի արժենա աշխատեցնելը, ինչը թույլ է տալիս օգտագործել այն ամեն կադրում կամ ստեղնահարվածում և տեղավորել հինգ տարվա հեռախոսում։ Voz-ը iPhone-ում տասը րոպեի աուդիոն երկու վայրկյանում արտագրում է տեքստի՝ 4.7 անգամ ավելի արագ քան Whisper-ը, ամեն բառի սկիզբն ու ավարտը նշելով։ Clear-ը 9MB մոդել է, որը հինգ րոպեանոց ձայնագրությունը մեկ վայրկյանում վերածում է ստուդիական որակի աուդիոյի։ Redact-ը անունները, հասցեները և քարտի համարները նույնականացնում և քողարկում է իրական ժամանակում 27 լեզվով, որպեսզի դրանք սերվեր չհասնեն։ Tongue-ը 2MB մոդելով երեք բառից ճանաչում է 84 լեզու՝ 0.933 միավոր 293MB դետեկտորի 0.887-ի դիմաց, իսկ Redact-ը որսում է անձնական տվյալների 88.8%-ը՝ ընդդեմ 2.3GB GLiNER-PII-ի 91.1%-ի։
Ինչու՞ սարքում
Լաբորատորիան լոկալ ինֆերենսը ներկայացնում է որպես Եվրոպայի ինքնիշխան լռելյայն. տվյալները չեն լքում հաճախորդի ձեռքը, ֆունկցիան կախված չէ ուրիշի ամպից, իսկ այն, ինչ երբեք չի վերբեռնվել, հնարավոր չէ պահանջել։ Տնտեսությունը հիմնվում է արդեն վճարված հաշվողական ուժի վրա. ոլորտը այս տարի տվյալների կենտրոնների վրա կծախսի մոտ 450 միլիարդ դոլար, մինչդեռ աշխարհում վաճառվում է ավելի քան մեկ միլիարդ հեռախոս, պլանշետ ու նոութբուք՝ ավելի ու ավելի հզոր չիպերով. մարդկանց ձեռքերում ավելի շատ հաշվողական ուժ կա, քան Երկրի բոլոր ԱԲ տվյալների կենտրոններում։ Desert Ant-ը նաև վկայակոչում է NVIDIA-ի հետազոտողներին, ովքեր, վերլուծելով երեք գործակալային համակարգեր, գնահատել են, որ դրանց կանչերի 40–70%-ը մեծ մոդելի փոխարեն կարող էր գնալ փոքր, մասնագիտացված մոդելին։ Յուրաքանչյուր մոդել անվճար է մինչև 100 000 ակտիվ սարք ամսական։
Վիդեո հավելվածից՝ սեփական մոդելներ
Թիմը հինգ տարի մշակել է Detail վիդեո հավելվածը, սակայն Auto Edit-ի կլիպերի ստեղծման և փոդքաստի ձայնի բարելավման համար ստիպված էր դիմել ամպային API-ներին, քանի որ ենթակառուցվածքի ծախսերը աճում էին։ Մոդելները նրանք իրենք մարզեցին. Clear-ը փոխարինեց Dolby-ին, Voz-ը սարքային տրանսկրիպցիան հինգ անգամ արագացրեց։ Clips-ը՝ 284MB մոդել, որը տասը րոպեանոց վիդեոն հինգ վայրկյանում դարձնում է մեկ տասնյակ կլիպ, փոխարինեց Claude Sonnet-ին. 10 անգամ արագ և 470 անգամ քիչ էներգիայով՝ նույն որակով, ըստ ընկերության։ Detail 6-ը, որը կթողարկվի iOS 27-ի հետ, բոլոր ամպային API-ները կփոխարինի սեփական մոդելներով՝ ամբողջությամբ սարքում։
Սկզբում՝ «փոքր ուղեղները»
Desert Ant-ը առաջին հարյուր մոդելը նկարագրում է որպես ուղեղիկ՝ փոքր ուղեղ, որը կատարում է մշտական ֆոնային աշխատանքը, իսկ հետո կգա կեղևի շերտը, որը կորոշի, թե որ մոդելը պատասխանի. սկզբում փոքր լոկալ մոդել, անհրաժեշտության դեպքում ավելի մեծը, և ամպը միայն այն ժամանակ, երբ աշխատանքը պետք է դուրս գա սարքից։ Մոդելները գալիս են ընտրված լռելյայնով և այն փոխելու լծակներով, իսկ runtime-ը օպտիմիզացվում է մոդելի հետ միասին. Clear-ն ու Voz-ը աշխատում են iPhone-ի Neural Engine-ում, իսկ բրաուզերում Clear-ի նույն կշիռները՝ WebAssembly-ով։ SDK-ն GitHub-ում է՝ փաստաթղթերով, Mac-ի CLI-ով և Hugging Face-ի ցուցադրություններով։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։