
Heretic ენის მოდელებს უარის თქმას დამატებითი წვრთნის გარეშე აცილებს
ღია კოდის ინსტრუმენტი Heretic ავტომატურად ხსნის უარის თქმის ქცევას ტრანსფორმერ-მოდელებს — მიმართულები აბლაციისა და Optuna-ს პარამეტრული ძიების მეშვეობით, ერთი ბრძანებით.
რა არის Heretic
Heretic უფასო, ღია კოდის პროგრამაა, რომელიც ტრანსფორმერ-არქიტექტურის ენის მოდელებს ცენზურას — იმას, რასაც შემქმნელები „უსაფრთხოების გასწორებას“ უწოდებენ — ძვირადღირებული დამატებითი წვრთნის გარეშე აცილებს. პროექტს ფილიპ ემანუელ ვაიდმანი მოხალისეებთან ერთად აქვეყნებს, საიტზე კი მიზანი პირდაპირაა ჩამოყალიბებული: მოდელი ყოველთვის უნდა მიჰყვეს მომხმარებლის მითითებებს.
ინსტრუმენტი აერთიანებს მიმართულები აბლაციის, ე.წ. „აბლიტერაციის“ განვითარებულ დანერგვას Optuna-ზე დაფუძნებულ პარამეტრთა ოპტიმიზატორთან. მეთოდი პოულობს მოდელის შიდა მიმართულებას, რომელიც უარის თქმას იწვევს, და შლის მას — მიდგომა 2024 წელს არდიტისა და კოლეგების კვლევაშია აღწერილი და შემდგომ ნაშრომებში განვითარდა.
როგორ მუშაობს
გასაშვებად GPU და ბრძანების ხაზი საკმარისია. ინსტალაციის შემდეგ მომხმარებელი გადასცემს Hugging Face-ის მოდელის იდენტიფიკატორს — დოკუმენტაცია მაგალითად Qwen/Qwen3.5-4B-ს იყენებს — და დანარჩენს პროგრამა თავად აკეთებს: აფასებს აპარატურას პარტიის ოპტიმალური ზომის ასარჩევად, იტვირთებს 400 „უვნებელ“ და 400 „საშიშ“ მოთხოვნას საჯარო მონაცემთა ნაკრებებიდან, ზომავს, რამდენად ხშირად თქვამს მოდელი უარს, და შემდეგ ეძებს აბლაციის იმ პარამეტრებს, რომლებიც ამ უარებს ამცირებს.
აპარატურული მოთხოვნები დღევანდელი სტანდარტებით მოკრძალებულია. დოკუმენტაცია მილიარდ პარამეტრზე დაახლოებით 2,5 გბ ვიდეომეხსიერებას ითვლის, ანუ 4-მილიარდიანი მოდელი დაახლოებით 10 გბ-იან ბარათზე ეტევა, bitsandbytes-ის 4-ბიტიანი კვანტიზაცია კი მეხსიერების ხარჯს დაახლოებით 70%-ით ამცირებს. საჭიროა Python 3.10 ან უფრო ახალი და PyTorch 2.2 ან უფრო ახალი ვერსია; მხარდაჭერილია როგორც Nvidia, ისე AMD-ის ვიდეობარათები. კონფიგურაციის ფაილი და ბრძანების ხაზის პარამეტრები პროცესის თითქმის ყველა ეტაპს აკონტროლებს.
შედეგები და გავრცელება
პროექტი აქვეყნებს საზომებს gemma-3-12b-it-ისთვის: საწყისი მოდელი 100 „საშიში“ მოთხოვნიდან 97-ზე თქვამდა უარს, Heretic-ის ვერსია კი მხოლოდ სამზე — შედეგი ხელით შექმნილ აბლიტერაციებს უთანაბრდება, თუმცა საწყის მოდელთან გაცილებით მცირე გადახრით. მისი KL-ქულა 0,16-ია, იმავე მოდელის ორი პოპულარული თემშექმნილი აბლიტერაციის 1,04 და 0,45-ის წინააღმდეგ.
Heretic მხარს უჭერს უმეტეს dense მოდელს, ბევრ მულტიმოდალურ მოდელს, რამდენიმე MoE არქიტექტურას და ჰიბრიდულ ვარიანტებს, როგორიცაა Qwen3.5; სუფთა state-space მოდელები ჯერ არ არის დაფარული. შემქმნელების თქმით, საზოგადოებამ Hugging Face-ზე 5000-ზე მეტი გაუცენზურო მოდელი გამოაქვეყნა, რომლებიც ამ ინსტრუმენტითაა შექმნილი. Heretic GNU AGPL v3 ლიცენზიით ვრცელდება, ხელმოწერილი გამოშვებები კი GitHub-ზე, Codeberg-ის სარკეში, Internet Archive-ზე და IPFS-ზეა ხელმისაწვდომი.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.