← უკან დაბრუნება
SiTech Team⏱️ 4 წთ. საკითხავი

ტვინის ტალღები — ფიზიკური AI-ს შემდეგი ნახტომი?

ტვინის ტალღები — ფიზიკური AI-ს შემდეგი ნახტომი?

Encord-ის მსგავსი სტარტაპები თვლიან, რომ ფიზიკური AI-ს განვითარების მთავარი შეზღუდვა არა მოდელის არქიტექტურა, არამედ რეალური მსოფლიოს მონაცემების სიმცირეა. ტვინის ტალღების წაკითხვა შესაძლოა ამ პრობლემის გადაჭრის გასაღები იყოს.

ტვინის ტალღები და ფიზიკური AI

წარმოიდგინეთ სიტუაცია: კალიფორნიის საწყობში, სან-ლეანდროში, მწვრთნელი ენდრუ სეხა ფრთხილად ამოაძრობს ხის ბლოკებს Jenga-ს კოშკიდან. თავზე მას ახვია სპეციალური ყურსასმენი, რომელიც არა მხოლოდ იმას აფიქსირებს, რასაც ის ხედავს, არამედ — მის ტვინის ტალღებსაც. ეს არის Encord-ის ლაბორატორია, სადაც იქმნება ფიზიკური AI-ს მომავალი.

TechCrunch-ის ჟურნალისტი ტიმ ფერნჰოლცი სწორედ ამ ლაბორატორიას ეწვია, რათა ახლოდან დაენახა, თუ როგორ ცდილობენ სტარტაპები ფიზიკური ხელოვნური ინტელექტის წინაშე არსებული ერთ-ერთი ყველაზე დიდი გამოწვევის გადაჭრას — რეალური სამყაროს მონაცემების სიმცირეს.

რატომ არის მონაცემები ფიზიკური AI-სთვის ასეთი მნიშვნელოვანი?

ფიზიკური AI (Physical AI) გულისხმობს რობოტებსა და ავტონომიურ სისტემებს, რომლებსაც შეუძლიათ რეალურ სამყაროში მოქმედება — ობიექტებთან ურთიერთობა, სივრცეში ნავიგაცია, ფიზიკური ამოცანების შესრულება. ChatGPT-ს მსგავსი ენობრივი მოდელებისგან განსხვავებით, ფიზიკურ AI-ს არ შეუძლია ისწავლოს მხოლოდ ინტერნეტიდან მოპოვებული ტექსტებით.

რობოტებს სჭირდებათ რეალური, ფიზიკური გამოცდილება — ათასობით და მილიონობით გამეორება იმისა, თუ როგორ აიღოთ ჭიქა, როგორ ჩაასხათ ყავა, როგორ გახსნათ კარი. ვინმემ უნდა "აჩვენოს" რობოტს, როგორ კეთდება ეს.

Encord-ის რობოტული სწავლების ხელმძღვანელი, ვინეტ ველმურუგანი, OpenAI-ს რობოტების ლაბორატორიისა და Berkshire Grey-ს ვეტერანია. მისი შეფასებით, ფიზიკური AI-ს გარღვევისთვის საჭირო იქნება YouTube-ის ვიდეო კორპუსზე დაახლოებით ხუთჯერ დიდი მონაცემთა ნაკრები. "მონაცემები უბრალოდ არ არსებობს", — ამბობს ის.

Encord-ის მიდგომა: მონაცემების წარმოება, არა შეგროვება

Encord-მა თავდაპირველად შექმნა პლატფორმა, რომელიც კომპანიებს მანქანური ხედვის აპლიკაციებისთვის მონაცემთა ანოტაციასა და მოდელების შეფასებაში ეხმარებოდა. თუმცა, როგორც მათმა კლიენტებმა — წამყვანმა რობოტიკის კომპანიებმა — დაიწყეს ბოლომდე სწავლების (end-to-end learning) გამოყენება რობოტული მანიპულაციისთვის, გაირკვა, რომ უბრალო მონაცემთა მართვა საკმარისი არ იყო.

დღეს Encord არა მხოლოდ მართავს მონაცემებს, არამედ ქმნის მათ. მათი San Leandro-ს ლაბორატორია სავსეა სხვადასხვა მანიპულაციური სადგურებით: ერთში რობოტის მკლავები ყავას ასხამს ფინჯანში, მეორეში — პოკერის ფიშკებს აწყობს, მესამეში — ethernet-ის კაბელებს აერთებს სერვერზე. ყველა ეს მოქმედება ჩაიწერება მრავალი კამერიდან, ზუსტი ანოტაციით.

"ყველა ჰუმანოიდური რობოტების კომპანიამ გვთხოვა ეს მონაცემები", — ამბობს ველმურუგანი. Encord-ის საცავებში ინახება ყველაფერი: ყალბი ყვავილებიდან დაწყებული, პლასტმასის ბოსტნეულით, წიგნებით, კატების საკვების ლანგრებით დამთავრებული — ის, რაც საჭიროა საყოფაცხოვრებო მანიპულაციის მწვრთნელებისთვის.

ტვინი-კომპიუტერის ინტერფეისები: ახალი განზომილება

Encord-ის ექსპერიმენტების ყველაზე საინტერესო ნაწილია თანამშრომლობა გერმანულ ნეირომეცნიერულ სტარტაპ Zander Labs-თან. ისინი ქმნიან ყურსასმენს, რომელიც იღებს ტვინის ტალღებს (EEG) ფიზიკური ამოცანების შესრულების დროს.

იდეა მარტივია, მაგრამ ღრმა: როდესაც ადამიანი ასრულებს ფიზიკურ ამოცანას — მაგალითად, ფრთხილად ამოაძრობს Jenga-ს ბლოკს — მისი ტვინი წარმოქმნის სიგნალებს, რომლებიც ასახავს განზრახვას, შეცდომის აღმოჩენას, გაკვირვებას. თუ რობოტს შეეძლება გაიგოს ეს ნეირონული სიგნალები, ის უკეთ გაიგებს, რა ხდება მოქმედების დროს.

Zander Labs-ის ნეირომეცნიერი ლუკას გერკე განმარტავს, რომ ტვინის აქტივობის რაოდენობა ნებისმიერ მოცემულ მომენტში გვაწვდის მინიშნებებს იმის შესახებ, თუ როდის სჭირდება მოდელს ყველაზე მაღალი ძალისხმევის გამოყენება. ეს არის "სისხლდენის კიდე" (bleeding edge) რობოტიკის მონაცემთა ბოსტელნეკის გადაჭრის მცდელობაში, ველმურუგანის სიტყვებით.

კუნთების სიგნალები და სხვა ახალი მოდალობები

ტვინის ტალღების გარდა, Encord ექსპერიმენტებს ატარებს კიდევ ერთი ახალი მოდალობით — კუნთების ელექტრული სიგნალებით. წინამხარზე დამაგრებული სენსორები აღრიცხავენ კუნთების ელექტრულ აქტივობას, რაც საშუალებას იძლევა 3D-ში აღვადგინოთ ხელის პოზიცია ნებისმიერ მომენტში.

ეს განსაკუთრებით მნიშვნელოვანია, რადგან ვიდეოჩანაწერები ხშირად ვერ ასახავს მთელ ხელს — თითები შესაძლოა დაიმალოს ობიექტის მიღმა. კუნთების სიგნალები ქმნის ბევრად უფრო ზუსტ გაგებას იმის შესახებ, თუ რას აკეთებს ხელი.

Encord-ის მონაცემთა ნაკრები ანოტირებულია ფიზიკური აღწერებით — "მარჯვენა ხელი ამაგრებს ხრახნს" — რაც LLM-ზე დაფუძნებულ მოდელებს ეხმარება გაიგონ, რა ხდება. ველმურუგანის შეფასებით, ასეთი ზუსტი ანოტაცია 100-ჯერ უფრო ღირებულია, ვიდრე "ნაგვის" ეგოცენტრული მონაცემები. ის მხოლოდ 20-ჯერ ძვირი ღირს — კარგი ვაჭრობა, ქაღალდზე მაინც.

მონაცემთა მწვრთნელები: ახალი პროფესია

საინტერესოა ისიც, რომ Encord-ის ლაბორატორიაში მომუშავე პილოტები — ენდრუ სეხა და სოფია ინფანტე — ქმნიან ახალი ტიპის სამუშაო ძალას. ისინი მანამდე Scale-ში მუშაობდნენ, AI მონაცემთა ანოტაციის კიდევ ერთ კომპანიაში. სეხა ადრე ნარჩენების მართვის კომპანიაში მუშაობდა, სადაც რობოტულ ნარჩენების გამყოფს პასუხობდა. ახლა ის ტვინის ტალღებს გამოიმუშავებს Jenga-ს თამაშისას — "ყოველდღე რაღაც ახალია!" — ამბობს ის.

განსხვავება LLM-ებისა და ფიზიკური AI-ს ეკონომიკაში

მიუხედავად იმისა, რომ Encord-ის მიდგომა პერსპექტიულია, ის ცხადყოფს ფიზიკურ AI-ს ერთ მთავარ გამოწვევას: მონაცემების ფასს. ენობრივი მოდელების შემქმნელებმა (როგორიცაა OpenAI, Anthropic) ინტერნეტიდან ტექსტების "მოპოვება" თითქმის უფასოდ შეძლეს. ფიზიკური მონაცემების წარმოება კი ძვირი ჯდება.

ეს ცვლის მოდელების აგების ეკონომიკას. მაგრამ ველმურუგანი ოპტიმისტურია. Encord-ის პოზიცია — იყოს ბევრ რობოტიკის კომპანიას შორის — აძლევს მათ უნიკალურ ხედვას იმაზე, თუ რომელი მონაცემთა ტექნიკები მუშაობს ინდუსტრიის მასშტაბით.

რას ნიშნავს ეს AI-ს მომავლისთვის?

Encord-ის ექსპერიმენტები ტვინის ტალღებთან, კუნთების სიგნალებთან და მრავალკუთხა ვიდეომონაცემებთან გვიჩვენებს, თუ სად მიდის ფიზიკური AI-ს ინდუსტრია. მომავალი არ არის მხოლოდ უკეთესი მოდელების შექმნა — ეს არის უკეთესი, უფრო მდიდარი და უფრო ზუსტი მონაცემთა ნაკრებების შექმნა.

თუ ტვინის ტალღები მართლაც გააუმჯობესებს რობოტების სწავლებას, ეს იქნება გარდამტეხი მომენტი. ჰუმანოიდულ რობოტებს, რომლებსაც დღეს ჯერ კიდევ უჭირთ მარტივი ამოცანების შესრულება — კაბელის ჩაერთვა, ჭიქიდან ჩამოსხმა — შესაძლოა ხვალ უკვე შეეძლოთ ათასობით რთული მოქმედების შესრულება.

და ყველაფერი იწყება იმით, რომ ვიღაცამ კალიფორნიის საწყობში, თავზე EEG ყურსასმენით, Jenga-ს ბლოკი ამოძრობს. ეს შესაძლოა არ იყოს ისეთი შთამბეჭდავი, როგორც ტერმინატორი, მაგრამ ეს არის ის, რაც რობოტებს ნამდვილად ინტელექტუალურს გახდის.

📖 წყარო