חזרה
Lakebase של Databricks מוחק את הגבול בין טרנזקציות לאנליטיקה
SiTech AI Team2 წთ. საკითხავი

Lakebase של Databricks מוחק את הגבול בין טרנזקציות לאנליטיקה

ניתוח שפורסם ב-HackerNoon טוען כי Lakebase — מנוע Postgres שרת-לס של Databricks הבנוי על ה-lakehouse הפתוח — מסיר את ההפרדה בת שלושת העשורים בין OLTP ל-OLAP ומעניק לסוכני AI מאגר מצב קבוע.

במשך יותר משלושה עשורים ארכיטקטורות נתונים ארגוניות נשענו על חלוקת עבודה נוקשה: מערכות טרנזקציוניות כמו PostgreSQL, MySQL ו-Oracle טיפלו במצב האפליקציה בזמן אמת, ומנועים אנליטיים כמו Apache Spark, Snowflake ו-Delta Lake החזיקו נתונים היסטוריים והריצו עומסי ML כבדים.

בין שני העולמות ישבו צינורות ETL שבירים ויקרים: ארגונים בנו מנגנוני סנכרון מורכבים כדי להעביר נתונים תפעוליים אל ה-lakehouse האנליטי, ואז התקשו להחזיר נתוני feature אל האפליקציות. בניתוח שפורסם ב-HackerNoon טוען הכותב כי Lakebase של Databricks — מנוע Postgres תפעולי ושרת-לס המבוסס על טכנולוגיית Neon ונבנה מעל ה-lakehouse הפתוח — מפרק את החומה הזו.

הדור השלישי של בסיסי נתונים

הכותב ממקם את Lakebase בקטגוריה חדשה ולא כמקרה managed Postgres נוסף. בסיסי הדור הראשון היו מונוליטים עם אחסון ומחשוב על שרתים ייעודיים; פלטפורמות הדור השני, OLTP ענן-נייטיב, הפרידו מחשוב מאחסון אך השאירו אחסון קנייני. Lakebase מתואר כדור שלישי: אחסון בפורמט פתוח על האגם, לצד מחשוב Postgres שרת-לס ואפמרלי.

zero-ETL: Postgres שרת-לס על אחסון lakehouse

הסתעפות, scale-to-zero ו-zero-ETL

שלושה מאפיינים ארכיטקטוניים בולטים. הסתעפות copy-on-write יוצרת שיבוטים מלאים ומבודדים במילישניות במקום שעות או ימים שנדרשים בסביבה מסורתית לשיבוט נתוני פרודקשן, כך שמפתחים וסוכני AI יכולים לבדוק שינויי סכימה ולפרק סביבות באופן מיידי.

הסתעפות בסגנון Git ל-Postgres

מחשוב מפורק מאפשר לאינסטנסים של Lakebase לעלות בפחות משנייה ולהתכווץ לאפס בזמן חוסר פעילות, מה שמעביר עומסי סוכנים מתפרצים מעלויות תשתית קבועות למודל של תשלום לפי שימוש. ומכיוון שנתונים טרנזקציוניים נכתבים בפורמטים שה-lakehouse יודע לקרוא, צוותים אינם זקוקים עוד לצינורות CDC או ETL מורכבים כדי להריץ שאילתות אנליטיות או להזין feature store למודלי LLM: Spark, Databricks SQL ו-Delta Lake שולפים נתונים תפעוליים חיים ישירות.

מה זה אומר למהנדסי נתונים ו-AI

תחת ממשל אחיד, טבלאות טרנזקציוניות ואנליטיות יכולות להיכלל באותה בקרת גישה, מדיניות אבטחה וניטור שושלת דרך Unity Catalog. הכותב מדגיש גם את הזיכרון של סוכני AI: סוכנים זקוקים לניהול מצב, חיפוש וקטורי דרך pgvector ושליפות מהירות בלי תקורת בסיס נתונים ארגוני.

המסקנה היא כיוון ולא מוצר מוגמר: כשארגונים עוברים מאינפרנס ML פשוט לסוכנים אוטונומיים ולצינורות בזמן אמת, בסיס הנתונים שמתחתיהם חייב להתפתח — לעבר פלטפורמות פתוחות, בזמן אמת, שרת-לס ו-AI-נייטיב.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.