უკან დაბრუნება
Anthropic-მ ბოდიში მოიხადა Claude Fable-ის ფარული შეზღუდვების გამო
SiTech AI Team2 წთ. საკითხავი

Anthropic-მ ბოდიში მოიხადა Claude Fable-ის ფარული შეზღუდვების გამო

Anthropic-მ აღიარა, რომ ახალი მოდელის, Claude Fable 5-ის, დისტილაციის მცდელობებზე ფარულად პასუხების შეცვლა არასწორი გადაწყვეტილება იყო და პირობა დადო, რომ შეზღუდვები ხილული გახდება.

Anthropic-მ ბოდიში მოიხადა იმის გამო, რომ თავისი ახალი მოდელი, Claude Fable 5, ფარული შეზღუდვებით დროში ზღუდავდა — ამან კი იმ მკვლევრებსაც ავნო, რომლებიც მოდელს კონკურენტი სისტემების შესაქმნელად იყენებდნენ. კომპანია ამბობს, რომ კურსს იცვლის და უფრო გამჭვირვალედ აცნობებს, როდის ამოქმედდება შეზღუდვები — თუნდაც ეს ნიშნავდეს, რომ Fable მეტ მოთხოვნაზე უარს იტყვის.

ფარული დაცვა და შემდეგ ბოდიში

Fable არის Anthropic-ის Mythos კლასის პირველი ფართოდ ხელმისაწვდომი მოდელი — ოჯახი, რომელზეც კომპანია თვეების განმავლობაში ამბობდა, რომ საჯარო გამოშვებისთვის ზედმეტად საშიშია. Anthropic-ის თქმით, ნაწილი რისკები იმით გადაჭრა, რომ Fable-ს დაამატა დაცვითი მექანიზმები გარკვეულ „მაღალი რისკის" მოთხოვნებზე პასუხის შესაზღუდად. ერთ-ერთი ასეთი სფერო დისტილაციაა — მეთოდი, როცა პატარა მოდელი დიდის შედეგებზე წვრთნის. მოდელის სისტემურ ბარათში კომპანია წერდა, რომ დისტილაციის მცდელობად მიჩნეულ მოთხოვნებს პირდაპირ შეცვლიდა და გააფუჭებდა, მომხმარებლისთვის კი არ შეატყობინებდა, რომ დაცვა ამოქმედდა ან რომ პასუხი შეიცვალა.

მარშრუტი Opus 4.8-ზე

ეს მიდგომა ახლა იცვლება. დისტილაციის მცდელობად მიჩნეული მოთხოვნები გადაერთვება Claude Opus 4.8-ზე — Anthropic-ის წინა ფლაგმანურ მოდელზე, — აცხადებს კომპანია X-ზე გამოქვეყნებულ პოსტში. მომხმარებელს ამის შესახებ შეატყობინებენ: „ამას ყოველ ჯერზე დაინახავთ". მექანიზმი იმეორებს იმას, როგორც Fable სხვა მაღალი რისკის სფეროებს — ბიოლოგიას, ქიმიასა და კიბერუსაფრთხოებას — ეხება: მოთხოვნები Opus 4.8-ზე გადადის, თუ ისინი სრულად არ იბლოკება ნარკოტიკების, იარაღისა და სხვა აკრძალული შიგთავსის წესებით. ბიოლოგიაში დაცვა იმდენად ფართოდ აღმოჩნდა გაწერილი, რომ Fable ძირითად კითხვებზეც კი პრაქტიკულად გამოუსადეგარია — ეს Anthropic-ის წარმომადგენელმა პარუულ მაჰეშვარმა The Verge-თანაც აღიარა.

მკვლევრების კრიტიკა

კურსის შეცვლას წინ უძღოდა AI კვლევითი საზოგადოების მწვავე კრიტიკა: ფარული შეზღუდვა მათზეც იმოქმედებდა, ვინც მოდელის დამოუკიდებლად შეფასებას ცდილობდა. სისტემურ ბარათში Anthropic ამტკიცებდა, რომ ახალი მოდელების უნარი, დააჩქარონ AI-ის განვითარება, ამგვარი მოთხოვნების შეზღუდვას ამართლებს და აღნიშნავდა: „Claude-ის კონკურენტი მოდელების შესაქმნელად გამოყენება უკვე არღვევს ჩვენს მომსახურების პირობებს". კომპანია ადრე ჩინელ კონკურენტებს, მაგალითად DeepSeek-ს, ადანაშაულებდა მისი მოდელების „ინდუსტრიული" მასშტაბით დისტილაციაში.

X-ზე გამოქვეყნებულ პოსტში Anthropic-მა ის კომპრომისიც ახსნა, რომელიც აირჩია: „ხილული დაცვა შეიძლება გამოსცადონ, ამიტომ ის მყარი უნდა იყოს, რაც დროს მოითხოვს. ფარული დაცვა უფრო ვიწროდ შეიძლება იყოს მიმართული, რაც სწრაფ გამოშვებასა და ცოტა ცრუ დადებით შედეგს იძლევა. სწორედ ამიტომ ავირჩიეთ ფარული დაცვა — და ეს არასწორი გაცვლა იყო. თქვენ უნდა ხედავდეთ, რა დაცვა გვაქვს და რატომ. ბოდიშს ვიხდით, რომ ბალანსი ვერ დავიცავით."

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.