Geri Dön
Codex ajanı otomatik araştırma yarışmasında QR çekirdeğini 232 kat hızlandırdı
SiTech AI Team2 წთ. საკითხავი

Codex ajanı otomatik araştırma yarışmasında QR çekirdeğini 232 kat hızlandırdı

GPU Mode ile Core Automation'ın düzenlediği yarışmada sankalp, 183 katılımcı arasında 12. oldu; çözümü temel QR çekirdeğinden 232 kat hızlı çalıştı.

GPU Mode ve Core Automation'ın düzenlediği otomatik araştırma yarışmasında sankalp adıyla yazan bir geliştirici, 183 katılımcı arasında 12. oldu. Çözümü, temel QR ayrıştırma çekirdeğinden 232 kat daha hızlı çalıştı. Blog yazısında, OpenAI'ın Codex ajanını ve sık bir gönderim döngüsünü nasıl kullandığını anlatıyor; bu yaklaşıma kendisi "loop engineering" diyor.

Sorun: toplu Householder QR

Katılımcıların toplu kare kompakt Householder QR ayrıştırması uygulamaları gerekiyordu. Girdi, batch × n × n biçiminde FP32 CUDA matrislerinden oluşan bir yığındı; çıktı ise torch.geqrf'in döndürdüğü kompakt biçimle aynı olmalıydı: H'nin üst üçgeni R'yi tutar, alt kısmı Householder vektörlerini saklar ve ayrı bir tau vektörü yansıma katsayılarını taşır. Denetleyici, torch.linalg.householder_product(H, tau) ile Q'yu yeniden kurup A ≈ QR, QᵀQ ≈ I ve QᵀA ≈ R koşullarını doğruluyordu.

Doğru gönderimler, farklı boyutlar ve koşullandırma durumlarındaki geometrik ortalama çalışma süresine göre sıralandı. Kilit boyutlar 512×512 ile birlikte 1024, 2048 ve 4096'ydı. İçeride FP16, FP8 veya NVFP4 hesabına izin veriliyordu, ancak sonuç yine de FP32 düzeyinde kontrolleri geçmek zorundaydı.

Döngüde Codex

GPU Mode'un sağladığı popcorn CLI aracı, ajanların doğrudan test etmesine, ölçmesine ve skor tablosuna gönderim yapmasına olanak tanıyordu. 14 gün boyunca yazar 1.500'den fazla gönderim yaptı. Codex çalışma alanında problem tanımı, gönderim talimatlarını içeren AGENTS.md ve her denemeyi kaydeden bir günlük vardı. Sayısal hedefler için /goal komutunu, döngüyü durdurmadan kontrol için /btw'yi, darboğazları bulmak için Modal ve NCU profillemesini kullandı.

Yerel maksimumlara takılmamak için tek bir en iyi aday yerine üç ile beş fikirlik bir "ışın" tuttu, yeni fikirler için daha güçlü bir danışman modelden yararlandı ve zaman zaman alt ajanları ayrı deneylere gönderdi.

419 ms'den 1,8 ms'ye

Temel torch.geqrf yolu toplamda yaklaşık 419.000 mikrosaniye sürüyordu. n = 512 boyutu için bloklu Householder yaklaşımı uygulandıktan sonra yazar bir gün içinde 5.000 mikrosaniyeye ulaştı; kaydedilen nihai sonuç 1.805 mikrosaniye oldu. Bloklu algoritma, bir panelin yansımalarını tek bir rank-b WY güncellemesinde sıkıştırıp art kalan bloğun işini üç matris çarpımına çeviriyor — tensor çekirdeklerinin en iyi işlediği biçim bu.

Neler kalıcı

Yazarın vardığı sonuç: alan bilgisi hem koşum takımının tasarımını hem de ajanın yönlendirilmesini hızlandırıyor; problemi ne kadar iyi bilirseniz ajana sorduğunuz sorular o kadar isabetli oluyor. Bu yarışma onun otomatik araştırmadaki ilk ciddi denemesiydi ve serinin ikinci yarışması — özdeğer ayrıştırması — şimdiden başlamış durumda.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.