90%的智能问数项目,为什么都成了摆设?

· 2026-09-15 07:15 · 3 阅读

带你读懂数据的 2026-09-15 07:15 广东

以下文章来源于:分析老贼

分析老贼

这是数据分析师的进阶基地。我们聊BI工具、看指标体系、做业务建模、讲实战案例,帮你从分析报表到洞察业务,真正用数据说话。

十年过去,换了AI的马甲,换了ChatBI的口号,失败率没有任何改善。

过去两年,“智能问数”成了BI行业最热的概念。

几乎所有主流厂商都完成了自然语言查数的能力建设,IDC数据显示,2025年中国BI市场中具备AI对话分析能力的产品占比已超过70%。

随便一家BI厂商只要把大模型接到系统里,喊一句“一句话出数”,就能拿到订单。

但真实的落地情况并不乐观,2026年调研显示,90%已部署ChatBI的企业,业务部门实际使用率不足30%。

不少企业全量上线自然语言问数功能后,实际活跃使用率不足业务总人数的20%,多数业务人员试过一两次后便回到传统取数流程。

这不是个别项目的失败,是行业性的价值交付失灵。

一、数据不是真相

Gartner在2026年1月预测,超过60%的早期智能体编排实施将无法达到性能或成本预期。

标准普尔的数据显示,2024年仅有17%的企业放弃了大部分AI计划,到了2025年这一数字暴涨至42%。

Gartner还预测,到2027年底超过40%的智能体AI项目将被取消。

兰德公司、IDC及Gartner的综合数据显示,全球2025年投入约6840亿美元于AI领域,其中高达5470亿美元的投资未转化为可衡量的业务成果。

MIT的研究发现,95%的生成式AI试点项目未能为企业带来可衡量的快速收入增长或财务回报。

企业平均会在进入生产环境前废弃约46%的概念验证项目,88%的项目陷入了“试点炼狱”,演示环境表现完美,但无法在真实业务中稳定运行

金融服务领域AI数据查询项目的失败率估算达82%,医疗健康领域高达80%-95%。

当一个技术方向在资本最雄厚、数据基础最扎实的行业都遭遇如此高的失败率时,问题已经无法用“行业还在早期”来解释了。

二、语言不是接口

“智能问数”在多数厂商的宣传中,被简化为一个NL2SQL的技术问题

仿佛只要接入一个强大的大语言模型,让用户用自然语言提问、系统自动生成SQL查询,就能解决数据分析的所有障碍。

这个假设在技术演示中效果惊艳,但在真实的企业生产环境中,它是一条充满陷阱、难以走通的路。

1、语义鸿沟是第一道屏障

业务人员口中的“GMV”、“新客”、“环比增长”,在数据仓库中可能对应着数十种不同的表、字段和计算逻辑。

同一个业务术语,在不同部门、不同系统中有完全不同的定义。

销售部的“GMV”可能包含所有已支付订单,财务部的“GMV”必须剔除退款和内部测试订单。

大语言模型再强大,也无法仅凭问题文本推测出企业内部的业务规则

一句“上个月华东区新客GMV环比增长多少”背后,隐藏着大量需要明确的细节:

  • “上个月”是自然月还是财月?

  • “华东区”是否包含安徽?

  • “新客”采用哪个定义?

  • “环比”是和哪个周期对比?

这些问题无法靠自然语言理解解决,必须依赖企业内部公认的业务规则和统一的数据语义。

2、口径不一致是更深层的结构性问题

  • 同一个“销售额”,在不同部门可能有三种定义

  • 同一张数据集里的“日期”可能是订单日期,也可能是出库日期

  • “金额”可能是包含优惠的订单金额,也可能是用户实付金额

当大模型面对这些混乱的字段时,即使SQL生成得再完美,如果用错了表、用错了口径,输出的就是错误的结论。

智能问数面临的真正瓶颈,往往不在于大语言模型理解自然语言的能力,而深藏于其背后庞大而复杂的数据基础设施之中

  • 如何将用户模糊、多变的业务意图精准地映射到企业纷繁复杂的物理数据资产中?

  • 如何确保不同用户在不同场景下问到同一指标时能返回一致的结果?

这些问题的本质是数据工程问题,而非单纯的AI问题。

3、给旧BI打补丁的方案不可持续

行业内的第一种做法是在原有BI系统上增加一层字段注释,告诉大模型“这个字段叫什么、是什么意思”

但随着业务发展,数据集持续增加,每个数据集都有自己的规则和口径。

维护这些静态注释的成本随时间指数级上升,当规则多到一定程度,连管理员自己都搞不清哪个是对的。

4、语义层方案同样面临现实阻力

另一种路径是建立统一的指标语义层,把所有指标、维度、规则都统一建模。

但搭建一套完整的语义层需要跨部门对齐所有指标定义,少则数月,多则不好说。

在业务快速变化的环境中,等语义层建完,业务规则早已改变。

语义层不是技术问题,它是数据治理成果的封装,而大多数企业连基础数据口径都尚未统一。

三、准确率不是终点

行业内的另一个常见话术是强调“准确率”。

厂商们热衷于展示99%甚至更高的NL2SQL准确率,仿佛只要SQL生成足够精确,智能问数就自然可用。

但这个数字是在什么条件下测出来的?

在定义清晰、范围受控的演示环境中,主流模型确实能写出带关联、带聚合的SQL。

但演示环境是“温室”,真实业务是“荒野”。

真实业务环境中的表结构复杂度、数据质量问题、口径不一致问题,在演示环境中都不会出现,准确率数字无法反映真实业务场景下的可用性。

更关键的是:业务人员需要的从来不是数据本身,而是答案。

  • 你问AI“为什么这个月利润下降了”,它给你拉一张各区域的利润表

  • 你追问“哪个区域下降最多”,它给你拉华东区的趋势图

  • 你继续追问“华东区为什么下降”,它给你拉各产品的销量对比

整个分析的思路、逻辑、判断,还是需要用户自己完成,盯着一堆图表拼凑原因,自己判断哪个因素影响最大,自己决定下一步该怎么做。

这哪里是智能?

这不过是把“IT帮业务查数”变成了“AI帮业务查数”。

交互方式从拖拽变成了说话,但本质上还是在做同一件事,查数,不是分析。

真正的智能分析至少需要三个阶段:

  • 第一阶段:“会说话的查询器”,即当前的NL2SQL形态,把自然语言转成SQL,帮你查到数据;

  • 第二阶段:“会分析的Agent”,能主动完成分析任务,自动发现异常、拆解原因、验证假设、输出结论;

  • 第三阶段:“会决策的伙伴”,能预测结果、自动采取行动。

绝大多数产品至今仍停留在第一阶段。

四、这不是技术问题

Gartner指出,40%的智能体AI项目将在明年崩溃,但失败原因几乎从不在于模型本身。

企业往往在未明确成功标准和应急机制的情况下直接构建智能体,将其部署在为人工执行设计的流程中,导致问题被放大。

MIT的研究团队追踪了企业AI项目失败的实际原因,将其归结为一个“学习鸿沟”,工具没有适应人的工作方式,而人也从未被真正教会如何使用这些工具。

他们发现,从专业供应商处购买解决方案并建立合作伙伴关系的成功率约为67%,而内部自建的成功率只有前者的三分之一。

换言之,失败的主要原因是落地方式,而非技术本身。

1、数据治理的缺失是根本性的前置障碍

Gartner预测,数据质量不佳将成为企业部署AI等先进分析技术的主要挑战之一。

但问题不仅是数据质量,更是数据定义的一致性。

当企业连“收入”按签单还是回款计算都无法统一时,任何基于这些数据构建的AI系统都只能在不确定的基础上运行。

2、组织惯性同样不可忽视

MIT的研究还记录了一个“影子AI经济”现象:员工私下使用ChatGPT等消费级工具,因为官方平台使用起来太复杂。

企业购买了昂贵、合规、安全的系统,员工绕过了它。

不是出于反抗,而是出于摩擦,当官方工具的使用门槛高于用户愿意付出的成本时,再强大的功能也无法转化为实际价值。

写在最后

我不是说AI+BI这个方向没有价值。

恰恰相反,真正的智能分析是未来最值得投入的方向之一。

智能问数面临的真正瓶颈,往往不在于大语言模型理解自然语言的能力,而深藏于背后庞大而复杂的数据基础设施之中。

但当前的行业叙事存在严重的系统性偏差。

  • 一个个号称“已落地”的案例,细查下去不是演示环境就是半死不活的摆设

  • 一份份标注“准确率99%”的宣传材料,从来不说明这个数字是在什么条件下测出来的

  • 一个个标价不菲的“智能问数”项目,上线后业务部门根本不用

是时候把注意力从“模型能力”转向“基础能力”了。

1)统一数据口径是前提

在数据定义不一致的情况下,任何AI输出的结论都是不可信的

2)建立业务语义层是基础

没有统一的语义抽象,大语言模型就只能靠猜

3)做好组织适配是保障

工具要适配人的工作方式,人要接受必要的训练

Gartner十年前就指出了BI项目的失败率——70%到80%。

十年过去,换了AI的马甲,换了ChatBI的口号,失败率没有任何改善。

原因从来不是技术不够强,是组织从来没有真正解决过数据定义不统一、口径不一致、治理缺失这三个根本问题。

AI只是把这些旧问题暴露得更快、更彻底,与其继续堆模型、堆算力、堆准确率数字,不如先把数据说清楚。

数据说不清楚,再强的AI也只是在帮你说错话。

我对这个方向依然抱有期待,但对这个行业当下的交付方式已经失去了耐心。

当90%的项目变成了摆设,问题已经不在技术本身了。

作者丨带你读懂数据的

来源丨公众号:分析老贼(ID:gh_e647163bfd26)

dbaplus社群欢迎广大技术人员投稿,投稿邮箱:editor@dbaplus.cn

跳转微信打开