90%的智能问数项目,为什么都成了摆设?
带你读懂数据的 2026-09-15 07:15 广东
以下文章来源于:分析老贼
分析老贼这是数据分析师的进阶基地。我们聊BI工具、看指标体系、做业务建模、讲实战案例,帮你从分析报表到洞察业务,真正用数据说话。

十年过去,换了AI的马甲,换了ChatBI的口号,失败率没有任何改善。
过去两年,“智能问数”成了BI行业最热的概念。
几乎所有主流厂商都完成了自然语言查数的能力建设,IDC数据显示,2025年中国BI市场中具备AI对话分析能力的产品占比已超过70%。
随便一家BI厂商只要把大模型接到系统里,喊一句“一句话出数”,就能拿到订单。
但真实的落地情况并不乐观,2026年调研显示,90%已部署ChatBI的企业,业务部门实际使用率不足30%。
不少企业全量上线自然语言问数功能后,实际活跃使用率不足业务总人数的20%,多数业务人员试过一两次后便回到传统取数流程。
这不是个别项目的失败,是行业性的价值交付失灵。

一、数据不是真相
Gartner在2026年1月预测,超过60%的早期智能体编排实施将无法达到性能或成本预期。
标准普尔的数据显示,2024年仅有17%的企业放弃了大部分AI计划,到了2025年这一数字暴涨至42%。
Gartner还预测,到2027年底超过40%的智能体AI项目将被取消。
兰德公司、IDC及Gartner的综合数据显示,全球2025年投入约6840亿美元于AI领域,其中高达5470亿美元的投资未转化为可衡量的业务成果。
MIT的研究发现,95%的生成式AI试点项目未能为企业带来可衡量的快速收入增长或财务回报。
企业平均会在进入生产环境前废弃约46%的概念验证项目,88%的项目陷入了“试点炼狱”,演示环境表现完美,但无法在真实业务中稳定运行。
金融服务领域AI数据查询项目的失败率估算达82%,医疗健康领域高达80%-95%。
当一个技术方向在资本最雄厚、数据基础最扎实的行业都遭遇如此高的失败率时,问题已经无法用“行业还在早期”来解释了。

二、语言不是接口
“智能问数”在多数厂商的宣传中,被简化为一个NL2SQL的技术问题。
仿佛只要接入一个强大的大语言模型,让用户用自然语言提问、系统自动生成SQL查询,就能解决数据分析的所有障碍。
这个假设在技术演示中效果惊艳,但在真实的企业生产环境中,它是一条充满陷阱、难以走通的路。
1、语义鸿沟是第一道屏障
业务人员口中的“GMV”、“新客”、“环比增长”,在数据仓库中可能对应着数十种不同的表、字段和计算逻辑。
同一个业务术语,在不同部门、不同系统中有完全不同的定义。
销售部的“GMV”可能包含所有已支付订单,财务部的“GMV”必须剔除退款和内部测试订单。
大语言模型再强大,也无法仅凭问题文本推测出企业内部的业务规则。
一句“上个月华东区新客GMV环比增长多少”背后,隐藏着大量需要明确的细节:
“上个月”是自然月还是财月?
“华东区”是否包含安徽?
“新客”采用哪个定义?
“环比”是和哪个周期对比?
这些问题无法靠自然语言理解解决,必须依赖企业内部公认的业务规则和统一的数据语义。
2、口径不一致是更深层的结构性问题
同一个“销售额”,在不同部门可能有三种定义
同一张数据集里的“日期”可能是订单日期,也可能是出库日期
“金额”可能是包含优惠的订单金额,也可能是用户实付金额
当大模型面对这些混乱的字段时,即使SQL生成得再完美,如果用错了表、用错了口径,输出的就是错误的结论。
智能问数面临的真正瓶颈,往往不在于大语言模型理解自然语言的能力,而深藏于其背后庞大而复杂的数据基础设施之中。
如何将用户模糊、多变的业务意图精准地映射到企业纷繁复杂的物理数据资产中?
如何确保不同用户在不同场景下问到同一指标时能返回一致的结果?
这些问题的本质是数据工程问题,而非单纯的AI问题。
3、给旧BI打补丁的方案不可持续
行业内的第一种做法是在原有BI系统上增加一层字段注释,告诉大模型“这个字段叫什么、是什么意思”。
但随着业务发展,数据集持续增加,每个数据集都有自己的规则和口径。
维护这些静态注释的成本随时间指数级上升,当规则多到一定程度,连管理员自己都搞不清哪个是对的。
4、语义层方案同样面临现实阻力
另一种路径是建立统一的指标语义层,把所有指标、维度、规则都统一建模。
但搭建一套完整的语义层需要跨部门对齐所有指标定义,少则数月,多则不好说。
在业务快速变化的环境中,等语义层建完,业务规则早已改变。
语义层不是技术问题,它是数据治理成果的封装,而大多数企业连基础数据口径都尚未统一。
三、准确率不是终点
行业内的另一个常见话术是强调“准确率”。
厂商们热衷于展示99%甚至更高的NL2SQL准确率,仿佛只要SQL生成足够精确,智能问数就自然可用。
但这个数字是在什么条件下测出来的?
在定义清晰、范围受控的演示环境中,主流模型确实能写出带关联、带聚合的SQL。
但演示环境是“温室”,真实业务是“荒野”。
真实业务环境中的表结构复杂度、数据质量问题、口径不一致问题,在演示环境中都不会出现,准确率数字无法反映真实业务场景下的可用性。
更关键的是:业务人员需要的从来不是数据本身,而是答案。
你问AI“为什么这个月利润下降了”,它给你拉一张各区域的利润表
你追问“哪个区域下降最多”,它给你拉华东区的趋势图
你继续追问“华东区为什么下降”,它给你拉各产品的销量对比
整个分析的思路、逻辑、判断,还是需要用户自己完成,盯着一堆图表拼凑原因,自己判断哪个因素影响最大,自己决定下一步该怎么做。
这哪里是智能?
这不过是把“IT帮业务查数”变成了“AI帮业务查数”。
交互方式从拖拽变成了说话,但本质上还是在做同一件事,查数,不是分析。
真正的智能分析至少需要三个阶段:
第一阶段:“会说话的查询器”,即当前的NL2SQL形态,把自然语言转成SQL,帮你查到数据;
第二阶段:“会分析的Agent”,能主动完成分析任务,自动发现异常、拆解原因、验证假设、输出结论;
第三阶段:“会决策的伙伴”,能预测结果、自动采取行动。
绝大多数产品至今仍停留在第一阶段。

四、这不是技术问题
Gartner指出,40%的智能体AI项目将在明年崩溃,但失败原因几乎从不在于模型本身。
企业往往在未明确成功标准和应急机制的情况下直接构建智能体,将其部署在为人工执行设计的流程中,导致问题被放大。
MIT的研究团队追踪了企业AI项目失败的实际原因,将其归结为一个“学习鸿沟”,工具没有适应人的工作方式,而人也从未被真正教会如何使用这些工具。
他们发现,从专业供应商处购买解决方案并建立合作伙伴关系的成功率约为67%,而内部自建的成功率只有前者的三分之一。
换言之,失败的主要原因是落地方式,而非技术本身。
1、数据治理的缺失是根本性的前置障碍
Gartner预测,数据质量不佳将成为企业部署AI等先进分析技术的主要挑战之一。
但问题不仅是数据质量,更是数据定义的一致性。
当企业连“收入”按签单还是回款计算都无法统一时,任何基于这些数据构建的AI系统都只能在不确定的基础上运行。
2、组织惯性同样不可忽视
MIT的研究还记录了一个“影子AI经济”现象:员工私下使用ChatGPT等消费级工具,因为官方平台使用起来太复杂。
企业购买了昂贵、合规、安全的系统,员工绕过了它。
不是出于反抗,而是出于摩擦,当官方工具的使用门槛高于用户愿意付出的成本时,再强大的功能也无法转化为实际价值。

写在最后
我不是说AI+BI这个方向没有价值。
恰恰相反,真正的智能分析是未来最值得投入的方向之一。
智能问数面临的真正瓶颈,往往不在于大语言模型理解自然语言的能力,而深藏于背后庞大而复杂的数据基础设施之中。
但当前的行业叙事存在严重的系统性偏差。
一个个号称“已落地”的案例,细查下去不是演示环境就是半死不活的摆设
一份份标注“准确率99%”的宣传材料,从来不说明这个数字是在什么条件下测出来的
一个个标价不菲的“智能问数”项目,上线后业务部门根本不用
是时候把注意力从“模型能力”转向“基础能力”了。
1)统一数据口径是前提
在数据定义不一致的情况下,任何AI输出的结论都是不可信的
2)建立业务语义层是基础
没有统一的语义抽象,大语言模型就只能靠猜
3)做好组织适配是保障
工具要适配人的工作方式,人要接受必要的训练
Gartner十年前就指出了BI项目的失败率——70%到80%。
十年过去,换了AI的马甲,换了ChatBI的口号,失败率没有任何改善。
原因从来不是技术不够强,是组织从来没有真正解决过数据定义不统一、口径不一致、治理缺失这三个根本问题。
AI只是把这些旧问题暴露得更快、更彻底,与其继续堆模型、堆算力、堆准确率数字,不如先把数据说清楚。
数据说不清楚,再强的AI也只是在帮你说错话。
我对这个方向依然抱有期待,但对这个行业当下的交付方式已经失去了耐心。
当90%的项目变成了摆设,问题已经不在技术本身了。
作者丨带你读懂数据的
来源丨公众号:分析老贼(ID:gh_e647163bfd26)
dbaplus社群欢迎广大技术人员投稿,投稿邮箱:editor@dbaplus.cn
