უკან დაბრუნება
abliterated მოდელებს ინსტრუქციების შესრულება ცოდნაზე ადრე უფუჭდებათ
SiTech AI Team2 წთ. საკითხავი

abliterated მოდელებს ინსტრუქციების შესრულება ცოდნაზე ადრე უფუჭდებათ

dev.to-ზე გამოქვეყნებული ტექნიკური წერილის ავტორი ამბობს, რომ abliterated მოდელებში ცოდნაზე ადრე ინსტრუქციების შესრულება და გამოსავლის ფორმატის დაცვა უარესდება, ამიტომ ფორმატის დაცვა სისწორისგან დამოუკიდებლად უნდა გაიზომოს.

dev.to-ზე გამოქვეყნებული ტექნიკური წერილის ავტორი, abliterated ღია მოდელებზე მომუშავე Grunz-ის შემქმნელი, ამტკიცებს, რომ ასეთი ვარიანტების შემფასებლები არასწორს ზომავენ. Hugging Face-ზე ათასობით ასეთი მოდელია, და პირველი, რაც უარესდება, ცოდნა არ არის, არამედ მორჩილება.

რას აკეთებს abliteration

abliteration მოდელის აქტივაციათა სივრცეში უარის თქმის მიმართულებას პოულობს და წონებიდან ამოაქვს. არც გრადიენტული ნაბიჯია და არც სასწავლო მონაცემი: ეს წონების ჩასწორებაა და არა finetune. ბევრი ფიქრობს, რომ საქმე შესაძლებლობების გაცვლას ეხება: მორჩილებას იძენ და ზოგად ინტელექტს კარგავ, ამას კი იმით ამოწმებ, იცის თუ არა მოდელმა ფაქტები და კარგად წერს თუ არა. ავტორის თქმით, ზიანი აქ არ ჩანს.

ჯერ მორჩილება უარესდება, ცოდნა კი არა

ვარიანტებისა და მოდელების ოჯახების მიხედვით, პირველი, რაც უარესდება, ინსტრუქციების შესრულება და გამოსავლის ფორმატის დაცვაა. მოდელს მასალა მაინც ახსოვს, მაგრამ გაზომვადად უარესდება instruct შაბლონისა და prefill-ის დაცვა, stop-მიმდევრობების დაცვა, სტრუქტურირებული გამოსავლის კონტრაქტში (მაგალითად, JSON სქემა ან tool-call-ის სინტაქსი) დარჩენა და გრძელ კონტექსტში system prompt-ის შეზღუდვის შენარჩუნება. მოდელი, რომელიც MMLU-ზე საბაზისოსთან შეცდომის ფარგლებში რჩება, სტრუქტურირებულ გამოსავალს გაცილებით ხშირად ამცდება.

რატომ ვერ იჭერს ამას ჩვეულებრივი შემოწმება

სტანდარტული შეფასება საუბარია: ამოწმებ, მოდელი აღარ ამბობს უარს და პროზა კარგად იკითხება თუ არა. ხარვეზს ეს ტესტი ვერ აღმოაჩენს, რადგან მოდელი ნორმალურად გამოიყურება. პრობლემა მოგვიანებით იჩენს თავს: როცა მოდელს ისეთ სისტემაში აერთებ, რომელიც მის გამოსავალს პარსავს, წარუმატებლობების რიცხვი იზრდება. perplexity ამაში ვერ გვეხმარება: ზოგად კორპუსზე ის თითქმის არ იცვლება, ფორმატის დაცვა კი მკვეთრად ეცემა.

ავტორი გვთავაზობს, ფორმატის დაცვა ხარისხისგან და სისწორისგან დამოუკიდებლად შეფასდეს: გააგზავნე მოთხოვნები ზუსტად განსაზღვრული გამოსავლის კონტრაქტით, შეაფასე კონტრაქტის ორობითი დაცვა და არა შიგთავსის სისწორე, და გამოაქვეყნე შედარებადი მაჩვენებელი. სწორად ფორმირებული მცდარი პასუხი 1,0 ქულას იღებს, სქემის დამრღვევი პროზა კი 0-ს.

quant-ებთან ურთიერთქმედება: ვარაუდი

quant-ებთან ურთიერთქმედებას ავტორი პირდაპირ ვარაუდად აცხადებს, რომელიც სათანადოდ არ გაუზომავს: ზიანი, როგორც ჩანს, quant-ის ზიანს ემატება, ამიტომ abliterated მოდელი ფორმატის დაცვაში quant-ის კიბეზე საბაზისოზე უფრო სწრაფად უარესდება. თუ ეს ასეა, abliteration-მა ის სტრუქტურა უკვე გაასწორა, რომელსაც quant-ი შემდეგ ამრგვალებს. ავტორს პატარა მოდელებზე q6_K-სა და ზემოთ უკეთესი შედეგები აქვს, 4B მოდელის q8_0 კი მხოლოდ დაახლოებით 4,3GB-ს იკავებს. სწორი ტესტი საბაზისო მოდელისა და მისი abliterated წყვილის ერთსა და იმავე bits per weight-ზე quant-ვაა და perplexity-ის ნაცვლად შესაბამისობის მაჩვენებლის გაზომვაა. წარმოებაში, ავტორის თქმით, tool-call-ის პარსერი უფრო შემწყნარებელი უნდა იყოს და შესაბამისობის მაჩვენებელი ცალკე მეტრიკად აღირიცხოს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.