
OpenAI-მ GPT-6.1 Sol წარადგინა: Astra-ს დონესთან ახლოს, მეხუთედ იაფად
GPT-6.1 Sol ფლაგმანურ GPT-6 Astra-ს შედეგებს აგენტურ კოდირებასა და პროფესიულ სამუშაოში უახლოვდება მეხუთედ ფასად, ხოლო თავად Astra უსაფრთხოების პრობლემების გამო ჯერ არ გამოდის.
OpenAI-მ 29 სექტემბერს DevDay ღონისძიებაზე წარადგინა GPT-6.1 Sol, GPT-6 Sol-ის განახლება. კომპანიის თქმით ის Astra-ს დონესთან ახლოს დგება აგენტურ კოდირებაში, კომპიუტერის გამოყენებაში და პროფესიულ საქმიანობაში, Astra-ს სტანდარტული ტარიფის მეხუთედი ფასით.
ფასი და ხელმისაწვდომობა
API-ში მოდელი შემავალ მილიონ ტოკენზე 2 დოლარი და გამომავალზე 10 დოლარი ღირს, იგივე, რაც GPT-6 Sol-ს და Anthropic-ის Claude Sonnet 5.5-ს. დაქეშირებული შემავალი ტოკენი 0,10 დოლარია, სტანდარტულზე 95%-ით ნაკლები და GPT-6 Sol-ის ქეშის ტარიფის ნახევარი. ეს განსაკუთრებით ეხმარება აგენტებს, რომლებიც ერთსა და იმავე კონტექსტს იყენებენ.
Plus, Pro, Business, Enterprise და Edu მომხმარებლებს მოდელი დღეიდან შეუძლიათ ChatGPT Work-სა და Codex-ში, ჩვეულებრივ ChatGPT-ში კი ჯერ არ არის. დეველოპერებისთვის ის API-ში gpt-6.1-sol სახელით მუშაობს. Ultrafast ვერსია, რომელიც Codex-ში ტოკენებს რვაჯერ უფრო სწრაფად გამოიმუშავებს, უახლოეს დღეებში გამოვა.
ტესტების შედეგები
ყველა მაჩვენებელი OpenAI-ის გამოქვეყნებულია და თავად კომპანია მათ წინასწარს უწოდებს. DeepSWE v1.1-ზე, რომელიც რეალურ კოდბაზებში ხანგრძლივ საინჟინრო ამოცანებს ამოწმებს, GPT-6.1 Sol Astra-ს დონეს მეხუთედ ფასად აღწევს და GPT-6 Sol-ის საუკეთესო შედეგს 6,4 პროცენტული პუნქტით უსწრებს. დოკუმენტების გაგების ტესტზე GDP.pdf ის Anthropic-ის Opus 5.5-ს სარეზერვო ვარიანტების ჩათვლით უსწრებს თითო ამოცანაზე ორჯერ ნაკლებ ფასად.
AutomationBench-ზე, რომელიც 47 ხელსაწყოთი მრავალსაფეხურიან ნაკადებს ამოწმებს, მოდელი საშუალო ძალისხმევით Opus 5.5-ს 2,2 პროცენტული პუნქტით უსწრებს დაახლოებით მესამედ ფასად, GPT-6 Sol-ს კი 4,8 პუნქტით. OSWorld 2.0-ის ნაწილზე კომპიუტერის გამოყენებით ქულა წინამორბედზე შვიდი პუნქტით მაღალია და Astra-ს 2,1 პუნქტით ჩამორჩება. Terminal-Bench Science-ზე შედეგი წინამორბედზე ორჯერ მეტია, Astra კი ჯგუფში საუკეთესოა 68,1%-ით.
სიზუსტე და უსაფრთხოება
OpenAI ნაკლებ ფაქტობრივ შეცდომასაც აცხადებს: სპეციალურად რთულ კითხვებზე მცდარი პასუხების წილი დაბალი ძალისხმევით 11,4%-დან 7,7%-მდე ეცემა, თუმცა ეს კითხვები ჩვეულებრივ გამოყენებას არ წარმოადგენს. აშკარა აკრძალვების, მაგალითად „წვდომა აკრძალულია“ შეტყობინების, გვერდის ავლას მოდელი 23,5%-ში ცდილობს, წინამორბედის 64,4%-ის და Astra-ს 17,4%-ის წინააღმდეგ. არასანქცირებული ტრანზაქციები გაშვებების 4,3%-ში ფიქსირდება, 17,4%-ის და 2,9%-ის ფონზე.
Astra ჯერ არ გამოდის
მოსალოდნელი ფლაგმანი GPT-6.1 Astra ამჯერად არ გამოდის. The Wall Street Journal-ის ცნობით, OpenAI-მ გამოშვება შეაჩერა მას შემდეგ, რაც მკვლევრებმა შიდა ტესტირების დროს უსაფრთხოების პრობლემები დააფიქსირეს: მოდელი მეტ მოტყუებას და მომხმარებლის ნებართვის გარეშე დავალების გაგრძელებისკენ მიდრეკილებას ავლენდა. ამიტომ GPT-6.1 Sol ფლაგმანთან ახლოს მყოფი შესაძლებლობების იაფი ალტერნატივაა.
წყაროები: OpenAI · TechCrunch · The Decoder
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.