Geri Dön
4B açık model, aramada GPT-5.6 Sol ile başa baş — 100 kat daha ucuz
SiTech Team2 წთ. საკითხავი

4B açık model, aramada GPT-5.6 Sol ile başa baş — 100 kat daha ucuz

Neon ve Castform'un ortak yazısı, RL ile yeniden eğitilen 4B açık kaynak bir modelin arama görevlerinde sınır modelle başa baş geldiğini ve maliyeti yaklaşık 100 kat düşürdüğünü gösteriyor.

Ajan tabanlı aramada maliyet sorunu

5 Ağustos 2026’da Neon, Castform ile ortak bir yazı yayımladı: pekiştirmeli öğrenmeyle (RL) yeniden eğitilen 4B açık kaynak bir model, arama görevlerinde tescilli bir sınır modelle yarışabiliyor ve istek başına maliyeti yaklaşık 100 kat azaltıyor.

Yazı, ajanların bilgiyi nasıl aradığındaki değişimi izliyor. 2022 civarında sektör gömme (embedding) aramasına yatırım yapıyordu — pgvector, Neon’un en çok indirilen uzantısı oldu — ve mühendisler RAG hattını elle kuruyordu. 2025’e gelindiğinde arama ajanlaştı: modeller tek bir sorgu yerine döngü içinde planlayıp arıyor. Döngünün her turu yeni bir sınır model çağrısı demek; gpt-5.6-sol ile tipik çok adımlı bir istek 10 saniyeden fazla sürüyor ve uçtan uca yaklaşık 0,03 dolara mal oluyor.

Açık bir modele aramayı öğretmek

Küçük açık ağırlıklı modeller yaklaşık 100 kat daha ucuz, ancak kutudan çıktığı haliyle kapalı API modellerinin gerisinde kalıyor. RL ile yeniden eğitim bu farkı kapatıyor. Castform’un amacı geliştiricilerin makine öğrenmesi ve GPU iç işleyişiyle uğraşmadan modelleri yeniden eğitebilmesi; kurucu ortak Ying Hang Seah bunu prompt mühendisliği kadar erişilebilir olarak tanımlıyor ve çoğu ekibin en iyi eğitim verisinin zaten kendi veritabanlarında durduğunu belirtiyor.

Hat tamamen Neon üzerinde çalışıyor: ham belgeler Postgres’te, sentetik eğitim görevleri lakebase_text ve lakebase_vector uzantılarıyla yazılıyor, her rollout’un arama çağrısı Lakebase Search üzerinden geçiyor ve üretim çıkarımı aynı arama aracını kullanıyor. Ödül fonksiyonu üç şeyi puanlar: doğru kaynağın bulunması, doğru parçanın alıntılanması ve doğru yanıta ulaşılması.

Patlamalı yükler için altyapı

Eğitim son derece düzensiz bir yük yaratıyor: her biri onlarca arama çağrısı yapan binlerce paralel rollout. Neon’un dinamik ölçeklendirmesi bu zirveleri, gün boyu maksimum kapasite ayırmaya gerek kalmadan emiyor. Yazarlara göre bu altyapı, ajanlar veriyi değiştirmeye başladığında daha da önemli hale geliyor: branching her rollout’a yalıtılmış bir veritabanı durumu veriyor, time-travel sorguları ise ajanın ne gördüğünü yeniden kurmayı sağlıyor.

Öne çıkan sonuç: arama gibi belirli bir görevde RL ile eğitilmiş açık bir model sınır modellerle yarışabiliyor ve onları kat kat düşük maliyetle geçebiliyor — yani ajan tabanlı arama artık en pahalı modelde çalışmak zorunda değil.

📖 Kaynak

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.