
从人类友好到Agent友好:数据库的下一场范式转移
根据Gartner 2025年发布的预测,到2028年,超过60%的企业数据查询将由AI Agent直接发起,而非通过传统BI工具或人工SQL编写。杨传辉在WAIC上提出的“数据库从人类友好到Agent友好”恰恰指向这一趋势。但问题在于:当前数据库的查询优化器、索引结构、事务模型,全都围绕“人类认知”设计——人类写SQL会考虑可读性,会刻意避免冗余,会遵循模式约定的命名习惯。Agent没有这些约束。
短期看,最直接的矛盾出现在查询频率和语义层级上。人类一天可能执行几十条SQL,而一个Agent在训练或推理时可能每秒发起数千次查询,且这些查询往往重复、碎片化。传统数据库的查询缓存和连接池并未针对这种“高频短查询”模式做优化。更关键的是,Agent的查询并非基于结构化表名,而是基于自然语言或向量表征。这要求数据库必须提供原生的语义解析层,将模糊意图映射到精确查询。目前主流方案依赖外部LLM做Text-to-SQL,但实验表明,在复杂多表关联场景下,准确率仍低于80%(如Spider榜单上的SOTA模型)。这背后是数据集的偏差——现有训练数据以人工标注的简单查询为主,缺乏对长尾业务逻辑的覆盖。
长期看,数据库需要重构自身的执行模型。我倾向于认为,未来的数据库将融合三种存储形态:关系表用于结构化事务,向量索引用于语义检索,知识图谱用于推理。杨传辉提到的“Agent友好”本质上就是让数据库能理解上下文、能预测查询模式、能主动提供预计算视图。这要求数据库的优化器从“静态规则”转向“动态学习”,即根据历史查询日志预判Agent的下一步操作,并提前物化中间结果。类似的工作在Google的Spanner中已有雏形,但距离产品化还有距离。
另一个被忽视的维度是权限与审计。人类操作数据库时有明确的身份和意图,而Agent调用链可能涉及多个模型、多个中间层。如何设计细粒度的、基于意图的访问控制?这需要数据库在元数据层面引入“使用场景”标签,并支持查询粒度的权限撤销。现有的RBAC模型显然不够。
我的预测是:未来三年内,将出现首个专为Agent设计的数据库基准测试(类似TATP或TPC-C),衡量指标包括“语义理解准确率”、“查询预判命中率”和“权限验证延迟”。届时,谁先跑通这个基准,谁就掌握了下一轮数据库竞争的入场券。
原文链接:https://www.leiphone.com/category/industrynews/nyoauJTE6FqhBvIB.html
物界前沿