Վերադառնալ
Databricks-ի Lakebase-ը ջնջում է սահմանը տրանզակցիաների և վերլուծության միջև
SiTech AI Team2 წთ. საკითხავი

Databricks-ի Lakebase-ը ջնջում է սահմանը տրանզակցիաների և վերլուծության միջև

HackerNoon-ում հրապարակված վերլուծության հեղինակը պնդում է, որ Databricks-ի Lakebase-ը՝ բաց lakehouse-ի վրա կառուցված serverless Postgres շարժիչը, վերացնում է OLTP-ի և OLAP-ի միջև եղած բաժանումը և AI գործակալներին տալիս մշտական վիճակի պահոց։

Երեք տասնամյակ կորպորատիվ տվյալների ճարտարապետությունները բաժանված էին երկու աշխարհի. PostgreSQL-ը, MySQL-ը և Oracle-ը կառավարում էին հավելվածի վիճակը իրական ժամանակում, իսկ Apache Spark-ը, Snowflake-ը և Delta Lake-ը պահում էին պատմական տվյալները և կատարում ծանր ML ծանրաբեռնվածություն։

Նրանց միջև ընկած էին փխրուն ու թանկ ETL խողովակաշարեր. ընկերությունները բարդ սինխրոնացում էին կառուցում՝ գործառնական տվյալները վերլուծական lakehouse տեղափոխելու համար, ապա դժվարանում էին feature տվյալները հետ վերադարձնել։ HackerNoon-ի վերլուծության մեջ հեղինակը պնդում է, որ Databricks-ի Lakebase-ը՝ Neon տեխնոլոգիայի վրա հիմնված serverless Postgres-ը՝ կառուցված բաց lakehouse-ի վրա, քանդում է այդ պատը։

Տվյալների բազաների երրորդ սերունդը

Հեղինակը Lakebase-ը դիտարկում է որպես նոր կատեգորիա, ոչ թե ևս մեկ managed Postgres ինստանս։ Առաջին սերնդի բազաները մոնոլիտներ էին, երկրորդ սերնդի cloud-native OLTP պլատֆորմները բաժանեցին հաշվարկը պահոցից, սակայն պահոցը մնաց սեփական։ Lakebase-ը երրորդ սերունդն է՝ բաց ֆորմատի պահոց լճի վրա՝ serverless Postgres հաշվարկի հետ։

zero-ETL. serverless Postgres լճի պահոցի վրա

Ճյուղավորում, scale-to-zero և zero-ETL

Առանձնանում են երեք ճարտարապետական հատկություններ։ copy-on-write ճյուղավորումը լիարժեք, մեկուսացված կլոններ է ստեղծում միլիվայրկյանների ընթացքում՝ ժամերի ու օրերի փոխարեն, որ մշակողներն ու AI գործակալները կարող են փորձարկել սխեմայի փոփոխությունները և միջավայրերը ակնթարթորեն հեռացնել։

Git-ի նման ճյուղավորում Postgres-ի համար

Առանձնացված հաշվարկը ինստանսներին թույլ է տալիս մեկ վայրկյանից պակասում միանալ և պարապ վիճակում զրոյի իջնել, ինչը գործակալների ծանրաբեռնվածությունը տեղափոխում է սպառման վրա հիմնված մոդել։ Քանի որ գործարքային տվյալները գրվում են lakehouse-ի կարդացած ֆորմատներով, բարդ CDC կամ ETL խողովակաշարեր այլևս պետք չեն. Spark-ը, Databricks SQL-ը և Delta Lake-ը հարցում են կենդանի տվյալները։

Ի՞նչ է սա նշանակում տվյալների և AI ինժեներների համար

Միասնական կառավարման ներքո գործարքային և վերլուծական աղյուսակները ենթարկվում են մուտքի վերահսկման, անվտանգության քաղաքականության և ծագման մոնիթորինգի մեկ հավաքածուի՝ Unity Catalog-ի միջոցով։ Հեղինակը առանձնացնում է նաև AI գործակալների հիշողությունը. գործակալներին անհրաժեշտ են վիճակի կառավարում, վեկտորային որոնում pgvector-ով և արագ գործարքային հարցումներ։

Եզրակացությունը ուղղություն է, ոչ թե պատրաստ ապրանք. երբ ընկերությունները անցնում են ինքնավար գործակալների, բազան նույնպես պետք է զարգանա՝ բաց, իրական ժամանակի, serverless և AI-բնիկ պլատֆորմների ուղղությամբ։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։