חזרה
Claude Opus 5.5 רוצה לסיים את משימות הקוד שלכם, לא רק להתחיל אותן
SiTech AI Team2 წთ. საკითხავი

Claude Opus 5.5 רוצה לסיים את משימות הקוד שלכם, לא רק להתחיל אותן

Anthropic מציגה את Claude Opus 5.5, ההשקה הראשונה במשפחת Claude 5.5, כסוכן שמוביל משימת קוד דרך כל מחזור הפיתוח — מהמפרט ועד לתיקון מאומת. אנשי מקצוע מזהירים: "הושלם" ו"נכון" אינם אותו דבר.

Claude Opus 5.5, ההשקה הראשונה במשפחת Claude 5.5 החדשה של Anthropic, מוצג פחות כמשלים קוד מהיר יותר ויותר כסוכן שיכול להוביל משימה דרך מחזור חיי הפיתוח כולו: מכתיבת מפרט עיצוב וניפוי שגיאות ועד יצירת קוד והרצת בדיקות. לפי The New Stack, המסר אינו להתחיל מהר יותר אלא לסיים.

סוכן שסוגר את הלולאה

השינוי שמתארים מפתחים הוא ארכיטקטוני. סרגיי ירמקוביץ', מייסד שותף ב-HasData, טוען שהמסוף "אינו עוד מקום שבו מפתח מדביק קוד מיוצר — המסוף הופך לחלק מסביבת העבודה של המודל". מכיוון שהמודל יכול להריץ פקודות, לבדוק כשלים, לשנות קבצים ולאמת את התוצאה, הוא סוגר את הלולאה בעצמו במקום להחזיר עבודה לא גמורה למהנדס. לדבריו, זה הופך משימות קטנות ומושלמות ליקרות ערך יותר: לתקן בדיקה אחת שנכשלת, לעדכן תלות אחת, לאמת — ולהמשיך הלאה.

מיגרציות, ביקורות ומחיר

Anthropic טוענת ש-Opus 5.5 חזק במיוחד במשימות ארוכות ומסועפות כמו מיגרציות וביקורות על פני כל בסיס הקוד. לפי הדיווחים, בודק מוקדם אחד בחן ותיקן בסיס קוד של 200,000 שורות בפחות משלוש שעות, בעוד Opus 5 נזקק ליותר מ-20 שעות ולפי 2.5 יותר טוקנים. בבדיקה פנימית, Opus 5.5 ו-Fable 5.1 כתבו מחדש את HAProxy מ-C ל-Rust ועברו כמעט את כל בדיקות הרגרסיה; Opus 5.5 סיים ב-9.5 שעות לעומת 12 ובעלות נמוכה ב-51%. המחיר: 4 דולר למיליון טוקנים בקלט ו-20 דולר למיליון בפלט, 20% פחות מ-Opus 5, וקריאת מטמון הוזלה ב-60%.

"הושלם" אינו "נכון"

אנשי מקצוע ששוחחו עם The New Stack מברכים על היכולת אך מזהירים שצוואר הבקבוק הוא כעת האימות ולא היצירה. אקאש טאקור, ארכיטקט אמינות AI עצמאי, אומר שמודלים ברמה הזו טובים באמת בפירוק פרויקט לחלקים ניתנים להשלמה, אך "הושלם" ו"נכון" אינם אותו דבר: המשימה שנראית גמורה היא לעתים קרובות זו שתעלה לצוות ביוקר, ולכן ההישג אינו בהסרת האדם אלא בהעברתו מכתיבת קוד לאימות שלו. מקסים ורמייר, סגן נשיא לאסטרטגיית AI ב-Abbyy, אומר שעידת ההשלמה האוטומטית הסתיימה וכיום מצפים לסגירת טיקט שלם ב-Jira.

מנגנוני הגנה וניתוב

Anthropic אומרת ש-Opus 5.5 נבדק לפני השחרור על ידי ארגונים חיצוניים, בהם Frontier Design ו-METR, והוא המודל החזק ביותר במבחן ההתאמה המקיף ביותר שלהם עד היום, עם שיפור בהתנהגויות הקשורות לאירועי סייבר אחרונים. כשמנגנוני ההגנה מופעלים, הבקשות עוברות בשקיפות למודל אחר: רוב משימות הסייבר מנותבות ל-Opus 4.8, ובקשות ביולוגיה או פיתוח LLM חזיתי מנותבות ל-Opus 5.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.