
2025 年 2 月,Andrej Karpathy 于 X 上顺手写下了 vibe coding 。 不到一年,它就成为了柯林斯辞书年度辞汇。 同时,瑞典公司 Lovable 的 ARR 于2026年6月冲到5亿美元。平台上每一周新增约100万个项目,累计跨越5000万个,此中八成用户没有技能配景。 Cursor 的 ARR 则从年头约 20 亿美元增加到年中靠近 40 亿美元,短短几个月完成翻倍。 这一趋向也险些同步发生于海内。蚂蚁灵光、baidu秒哒、腾讯 吐司 、字节 Trae险些成了年夜厂标配。 不外运用天生轻易,数据库的办事对于象也随着变了。之前数据库办事的是像淘宝、微信这类 极少量年夜运用,但 coding 时代,成千上万个运用都需要本身的数据空间。 而对于在 AI 天生运用来讲,数据空间其实不只是存储空间,更是一份支撑运用连续运行的“影象”。它需要生存运用的数据布局、营业状况,并包管后续可以或许被正确挪用及计较。 面临“海量 AI 天生运用×动态 Schema ”,这也对于数据基础举措措施提出新的挑战,本文将测验考试从现实运用出发,联合蚂蚁 OceanBase 的实践,拆解这一问题以和暗地里的其解决思绪。 01为何传统数据库方案最先掉效? 这股天生热潮终极会给数据库带来多年夜压力?先来看一组数据。 按照 Sensor Tower 的数据来看,2026年苹果市肆的上半年新增约56万个运用,险些相称在2025年整年总量。 整年有望冲破100万(此前纪录为2016年的89万)。明确归因在 vibe coding 东西(Replit、Bolt.new 等)带来的非专业开发者提交激增。 这象征数据库面临的再也不是 一个愈来愈年夜的数据库 ,而是数万万个相互自力的数据空间。 以蚂蚁灵光为例,上线四个月便累计天生了跨越 3000 万个闪运用。 与传统互联网运用差别,这些 AI 天生运用有着光鲜的新特性:数目巨年夜、单体数据量小、Schema(表布局)动态天生,绝年夜大都运用被 搓 出来玩频频就归在寂静,但用户哪天从头点开,又必需马上相应。 一名靠近项目的技能人士总结过这类负载的诡异的地方——传统的数据库范围问题,问的是 一个库能装几多数据 ;而这里的问题是 一套数据库能不克不及同时容纳3000万个互不不异的 小库 。 有人也许会认为,既然 AI 可以或许天生代码,数据计较是否是也能够交给年夜模子完成? 实际并不是云云。AI 擅永生成页面、代码甚至营业流程,但触及金额汇总、排序、过滤等需要绝瞄准确成果的计较,仍旧需要数据库完成。 以一个典型的记账闪运用为例:用户不仅要记下每一笔出入,还有要能 按月汇总支出 。而做这种切确计较的,不克不及是年夜模子——写诗、总结它擅长,但让它包管每一一分钱都对于患上上,今朝还有做不到;也不成能是平台——没有任何团队能为3000万个布局各别的运用挨个开发计较接口。 从 Agent 视角看,这些能力配合组成了运用的“运行影象”:Schema 界说运用怎样理解数据,营业数据记载运用与用户交互形成的状况,运用标识规定影象界限,SQL 卖力对于这些状况举行正确挪用及计较。 是以,灵光面临的不只是海量运用的数据存储问题,而是海量自力运行影象的治理问题:每一份影象都很小,但数目极多;布局各不不异,却必需相互断绝,并可以或许连续查询及更新。 以是每一个闪运用都需要一套货真价实的数据库能力:界说本身的表布局、读写数据、履行 SQL 查询。天生只要30秒,数据库的承诺却要是永世的。 是以,数据库依然负担着长期化存储及确定性计较的职责。 只是已往数据库的两种典型方案,于 AI 天生运用场景下都最先掉效。 第一条路,是所有运用同享一张 JSON 年夜表。它的上风是物理表数目少,但价钱一样较着,数据库原本擅长的 SQL 聚合、过滤、排序等能力难以直接利用,许多计较只能从头回到营业层实现,多租户场景下的数据权限断绝也变患上越发繁杂。这条路等在只解决了 存 ,抛却了 算 。 第二条路,为每一个运用零丁创立一张物理表。体验是完备的,但范围是灾害性的:每一创立一个运用就要对于数据库节制面倡议一次 DDL 操作,3000万次创立象征着节制面连续承压;而这些运用年夜大都据量极小,开消远超营业数据自己。就像为一个只住了两天的客人盖一栋楼,楼愈来愈多,住的人没几个。 蚂蚁集团平台技能事业群总架构师黄挺曾经云云形容: 不克不及让每一个人都零丁盖一栋屋子,也不克不及让所有人睡一个年夜通铺。 要知道数据库行业已往几十年的优化标的目的,不管是单机机能还有是漫衍式扩大,对准的都是 极少量、不变、巨型 的库表;而 AI 时代的负载第一次出现出 海量、动态、长尾 的形态。 以是 AI 时代真正需要的,是一条介在二者之间的新路径。 02 OceanBase:每一人一间办公室,同享一栋楼 既然 自力 及 同享 没法二选一,那末 OceanBase 则是于二者之间找到一条新的路径:将运用的数据模子与底层物理存储解耦:每一个运用连结自力的数据模子及拜候界限,底层则同享存储及计较资源。 OceanBase 产物部总司理韩富晟把这个方案比作一栋写字楼: 每一家公司都有本身自力的办公室,按本身的气势派头装修、存放文件,但整栋楼同享水电及物业。 放到数据库里,对于应的是一种新的设计思绪:逻辑自力,物理同享。每个 AI 运用看到的,仍旧是一张属在本身的数据表;而于底层,它们同享的是统一套物理存储资源。开发者不需要感知底层怎样构造数据,依旧根据认识的方式界说 Schema、编写 SQL,但数据库内部已经经换了一种构造方式。 为了做到这一点,OceanBase 起首把 表 拆成为了两层。 一层卖力记载每一个运用的数据布局,也就是 Schema;另外一层卖力生存真实的数据内容。所有运用的数据终极城市写入同享的数据表中,并以 JSON 情势存储,而各自的表布局则零丁维护。 不管平台新增几多运用,物理表的数目都不会再跟着运用数目线性增加。 不外把数据同一存成 JSON,只解决了一半的问题。 假如数据库只能存,不克不及算,那末开发者终极还有是需要把数据掏出来,于营业层从头完成聚合、过滤、排序等计较,这偏偏又回到了第一部门提到的那条 同享 JSON 年夜表 老路。 是以,OceanBase 又增长了一层 翻译 能力。 可以把它理解成一名同声传译。开发者依然编写尺度 SQL,不需要体贴底层数据是否以 JSON 情势生存;数据库会经由过程 JSON Table SDK 将这些 SQL 主动转换成对于同享存储的拜候方式,再使用 JSON_TABLE() 将 JSON 数据映照成瓜葛表,继承完成聚合、过滤、统计等计较。 对于在开发者来讲,数据库的利用方式险些没有变化;变化发生于数据库内部。 同享资源以后,另外一个必需回覆的问题是断绝。 3000万个运用同享一套存储,怎样避免 SQL 越界串门?方案是,于 SQL 履行历程中,每一条语句城市主动附带运用标识等限定前提,并联合白名单机制约束可履行规模。开发者看到的是一张属在本身的逻辑表,数据库真正履行时,则会主动完成拜候界限的节制。 这类设计还有带来了另外一个利益。 绝年夜大都 AI 天生运用生命周期短、拜候量低,同享资源可以或许显著降低运行成本;而当某个运用逐渐发展为高频营业时,又可以光滑迁徙到自力物理表,而无需从头设计数据布局。 从技能实现来看,这套方案从头界说数据库构造海量 AI 运用数据的要领:逻辑上连结自力,物理上尽可能同享;计较仍旧留于数据库完成,而不是从头回到营业层。 这也是 OceanBase 但愿解决的焦点问题——AI 数据平台怎样以可控成本,承载数万万个连续增加的数据空间。 03 数据库成为 AI 运用的 基础举措措施 据彭博社援引知恋人士报导,外界曾经将 OceanBase 看做中国的 Databricks 。 两家公司虽然出发点差别——前者从漫衍式数据库内核出发,后者从数据阐发及 AI 平台起步。但终极都于回覆统一个问题:AI 运用年夜范围涌现以后,数据基础举措措施应该怎样演进。 OceanBase 于灵光项目中的实践,给出的其实不是某一项技能,而是一种新的数据构造思绪:物理资源同享、逻辑界限自力、确定性计较留于数据库。 将灵光的案例放于更年夜的坐标系里看,它从头界说了数据库的 范围 。互联网时代,人们会商数据库,存眷的是单库容量、事件处置惩罚能力及机能;AI 时代,新的挑战酿成了怎样以有限资源承载万万级动态数据空间,同时统筹数据断绝、确定性计较及资源成本。 同时数据库负担的脚色也最先发生变化。 已往,它重要回覆 数据怎么存、怎么算 ;如今,跟着愈来愈多运用及数据拜候由 Agent 主动完成,它还有需要回覆 AI 怎样连续、安全地利用数据 ,以和怎样构造资源、办事开发者及 Agent。 当运用天生成本不停趋近在零,竞争最先从 怎样天生运用 转向 怎样承载运用 。 对于在 AI 运用开发者而言,模子决议了运用能做甚么,而数据基础举措措施则决议了运用可否真正跑起来、跑患上稳。这也许也是灵光案例最年夜的开导:AI转变了软件开发,也从头界说了数据库。 韩富晟暗示说,“ OceanBase 会连续摸索,搭建面向 Agent 的数据底座,为下一代 AI 运用构建真正可依靠的数据基础举措措施。” 3000万个闪运用只是这场摸索的第一站,当创立运用的门坎趋近在零,数据层的竞争才真正最先。(雷峰网雷峰网雷峰网(公家号:雷峰网)) 雷峰网原创文章,未经授权禁止转载。详情见转载须知。