უკან დაბრუნება
Codex-ის აგენტმა QR-ბირთვი 232-ჯერ ააჩქარა ავტო-კვლევის შეჯიბრში
SiTech AI Team2 წთ. საკითხავი

Codex-ის აგენტმა QR-ბირთვი 232-ჯერ ააჩქარა ავტო-კვლევის შეჯიბრში

GPU Mode-ისა და Core Automation-ის ავტო-კვლევის შეჯიბრში დეველოპერმა sankalp-მა 183 მონაწილეს შორის მე-12 ადგილი დაიკავა — მისი QR-დაშლის ბირთვი ბაზისურ ვერსიაზე 232-ჯერ სწრაფია.

GPU Mode-ისა და Core Automation-ის მიერ ორგანიზებულ ავტო-კვლევის შეჯიბრში დეველოპერმა, რომელიც ბლოგზე sankalp-ის სახელით წერს, 183 მონაწილეს შორის მე-12 ადგილი დაიკავა. მისი საბოლოო გადაწყვეტა ბაზისურ QR-დაშლის ბირთვზე 232-ჯერ უფრო სწრაფად მუშაობდა. ბლოგის ჩანაწერში ავტორი აღწერს, როგორ გამოიყენა OpenAI-ის Codex აგენტი და გაშვებების მჭიდრო ციკლი — მიდგომა, რომელსაც თავად „loop engineering“-ს უწოდებს.

ამოცანა: ბატჩური Householder-ის QR

მონაწილეებს უნდა განეხორციელებინათ ბატჩური კვადრატული კომპაქტური Householder-ის QR-დაშლა. შესავალი მონაცემი იყო batch × n × n ზომის FP32 CUDA მატრიცების ბატჩი, ხოლო გამოსავალი — იგივე კომპაქტური ფორმატი, რომელსაც torch.geqrf აბრუნებს: H-ის ზედა სამკუთხედში ინახება R, დიაგონალის ქვემოთ — Householder-ის ვექტორები, ხოლო ცალკე tau ვექტორი ინახავს არეკვლის კოეფიციენტებს. შემმოწმებელი torch.linalg.householder_product(H, tau)-ით აღადგენდა Q-ს და ამოწმებდა პირობებს A ≈ QR, QᵀQ ≈ I და QᵀA ≈ R.

სწორი გაშვებები ლიდერბორდზე რჩებოდა დროის გეომეტრიული საშუალოთი სხვადასხვა ზომისა და კონდიცირების შემთხვევისთვის. მთავარი ზომები იყო 512×512, ასევე 1024, 2048 და 4096. შიდა გამოთვლებში დაშვებული იყო FP16, FP8 ან NVFP4 სიზუსტე, თუმცა დაბრუნებული შედეგი მაინც FP32-ის დონის შემოწმებას უნდა აკმაყოფილებდეს.

აგენტური ციკლი Codex-ით

GPU Mode-ის popcorn CLI ინსტრუმენტი საშუალებას აძლევდა აგენტებს პირდაპირ გაეტესტათ, გაეზომათ და ლიდერბორდზე გაეგზავნათ შედეგები. 14 დღის განმავლობაში ავტორმა 1500-ზე მეტი გაშვება გააკეთა. Codex-ის სამუშაო სივრცეში იყო ამოცანის აღწერა, AGENTS.md ინსტრუქციებით და ჟურნალი, რომელიც ყოველ ცდას აღრიცხავდა. რიცხვითი მიზნებისთვის ის იყენებდა /goal ბრძანებას, ციკლის შეჩერების გარეშე შესამოწმებლად — /btw-ს, ხოლო ბარიერების მოსაძებნად Modal-ისა და NCU-ს პროფილირებას.

ლოკალურ მაქსიმუმებში ჩარჩენის თავიდან ასაცილებლად ავტორი ინახავდა სამიდან ხუთამდე იდეის „სხივს“, ახალი მიდგომებისთვის უფრო ძლიერ მოდელს იყენებდა, ხოლო ცალკეულ ექსპერიმენტებზე ზოგჯერ ქვე-აგენტებს აგზავნიდა.

419 მილიწამიდან 1,8-მდე

ბაზისური torch.geqrf მარშრუტი დაახლოებით 419 000 მიკროწამეს (419 მილიწამს) შეადგენდა. n = 512 ზომისთვის დაბლოკილი Householder-ის ალგორითმის დანერგვის შემდეგ ავტორმა ერთ დღეში 5000 მიკროწამეს მიაღწია, საბოლოო დაფიქსირებული შედეგი კი 1805 მიკროწამე იყო. დაბლოკილი ალგორითმი პანელის არეკვლებს აერთიანებს ერთ rank-b WY განახლებაში და დარჩენილ სამუშაოს სამ მატრიცულ გამრავლებად აქცევს — სწორედ ის ფორმა, რომელსაც tensor ბირთვები საუკეთესოდ ამუშავებენ.

დასკვნა

ავტორის დასკვნით, დომენური ცოდნა აჩქარებს როგორც სამუშაო გარემოს აწყობას, ასევე მოდელის მართვას: რაც უფრო კარგად იცნობს ადამიანი ამოცანას, მით უფრო ზუსტ კითხვებს უსვამს აგენტს. მისივე თქმით, ეს ავტომატურ კვლევაში პირველი სერიოზული ცდა იყო, ხოლო სერიის მეორე შეჯიბრი — საკუთარი მნიშვნელობების დაშლაზე — უკვე მიმდინარეობს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.