← უკან დაბრუნება
SiTech Team⏱️ 2 წთ. საკითხავი

Semantic Routers: Claude Code-ის Token-ების 456-ჯერ შემცირება

Semantic Routers: Claude Code-ის Token-ების 456-ჯერ შემცირება

როგორ ამცირებს semantic routing Claude Code-ის კონტექსტის მოხმარებას 456-ჯერ — 228K token-იდან მხოლოდ 500-მდე თითოეული task-ისთვის. სრული ანალიზი progressive disclosure-ის პრობლემაზე, embedding-ის მექანიზმზე და პრაქტიკული რჩევები AI Agent developers-თვის.

Skills-ის კატალოგის პრობლემა — რატომ არ ჯდება 4,556 skill 200K კონტექსტში

Claude Code-ის skills (და Cursor-ის, GitHub Copilot-ის, და ნებისმიერი სხვა AI agent framework-ის skills) მუშაობს მარტივი markdown ფაილების სახით ფოლდერში. თითოეულ skill-ს აქვს სახელი (title) და მოკლე აღწერა (description), რომლებიც ინახება ფაილის frontmatter-ში. როდესაც agent იწყებს მუშაობას, ის იყენებს ე.წ. "progressive disclosure" სტრატეგიას — ყველა skill-ის სახელი და აღწერა იტვირთება system prompt-ში სტარტზე, ხოლო სრული ტექსტი იტვირთება მხოლოდ მაშინ, როცა agent გადაწყვეტს მის გამოყენებას.

ეს მიდგომა კარგად მუშაობს მცირე რაოდენობის skills-ზე, მაგრამ კატასტროფულად იშლება მასშტაბში. Progressive disclosure წყვეტს body-ის პრობლემას — არ იხდით იმ skill-ების სხეულისთვის, რომლებსაც არ იყენებთ — მაგრამ ის საერთოდ არ წყვეტს ინდექსის პრობლემას. მხოლოდ სახელები და აღწერები იტვირთება ყველა skill-ისთვის, ყოველ სესიაზე, მანამ, სანამ რაიმე სამუშაო დაიწყება.

აი, როგორ გამოიყურება მათემატიკა:

  • 100 skill: ~5K token — 2.5% კონტექსტის
  • 500 skill: ~25K token — 12.5%
  • 1,000 skill: ~50K token — 25%
  • 4,556 skill: ~228K token — არ ჯდება 200K ფანჯარაში

როგორ მუშაობს Semantic Router

Semantic router-ის პატერნი მთლიანად ხსნის კატალოგს prompt-დან. თითოეული skill-ის სახელი და აღწერა ინახება ერთხელ embedding index-ში — რიცხვით ვექტორში, რომელიც აღწერს ტექსტის სემანტიკურ მნიშვნელობას. Task-ის შესრულების დროს agent აკეთებს ერთ semantic search ზარს task-ის აღწერის მიხედვით, პოულობს top-5 ყველაზე მსგავს skill-ს, ირჩევს ყველაზე რელევანტურს და კითხულობს მხოლოდ მის სრულ ტექსტს.

შედეგი: token-ების ღირებულება თითოეული turn-ისთვის მუდმივია, კატალოგის ზომის მიუხედავად — ~500 token-ი თითო task-ზე, ~228K token-ის ნაცვლად. ეს არის 456-ჯერ შემცირება.

ტესტის შედეგები

  • მკაცრი top-1 accuracy: 62.5%
  • top-5 cluster accuracy: 87.5% — საუკეთესო skill ხვდება top-5-ში 7-ჯერ 8-დან
  • ქვე-წამიანი query latency
  • ~500 token-ი თითო task-ზე vs ~228K token-ი ნაგულისხმევი მიდგომით

რატომ არის ეს მნიშვნელოვანი AI Agents-ისთვის

SiTech-ის მსგავსი აგენციებისთვის, რომლებიც AI Agents-ზე აშენებენ თავიანთ სერვისებს, ეს პატერნი ტრანსფორმაციულია. Agent-ის ეფექტურობა პირდაპირ დამოკიდებულია კონტექსტის მართვაზე — semantic routing ხდის კონტექსტის გამოყენებას პროგნოზირებადს, მიუხედავად იმისა, რამდენი skill გაქვთ. პრაქტიკული შედეგები მნიშვნელოვანია: დაბალი token ხარჯები, სწრაფი response დრო, უკეთესი accuracy skill-ების შერჩევაში, და მასშტაბირების შესაძლებლობა ათასობით skill-ზე ხარისხის დეგრადაციის გარეშე.

📖 წაიკითხე სრული სტატია HackerNoon-ზე