上次百度 ChatBI 的文章发布了之后,没想到触发了和很多其他公司小伙伴学习交流的机会。于是这两周的时间,约了京东、美团和快手还有一些厂商的小伙伴交流切磋了一番。大家虽然都是所谓的“数据产品”,但其实团队定位和所负责的方向都有些差异,又都在做LLM 落地相关的事情,非常有趣。于是开启了这个系列的第二篇文章,用作记录交流的这几个团队都在做些什么以及背后的一些思考。
💥大家都在做哪些场景?
💥是为了追热点还是真正产生作用?
💥AI 取数背后的两种路径之争?
💥投入产出的衡量?

💥 大家在做哪些场景?
最近交流的伙伴里,有人是做纯工具方向的,有人是做商业化BI 的,还有人是做数据中台的......虽然样本数量不够高,但是也确实挺多样的。共性的特点也是今天的主题,他们都在想办法用 AI 融入到自己的数据工具或者数据内容建设中。这几次讨论下来,发现大家在尝试做的场景有:
-
SQL 纠错工具
-
GPT 套壳的数据“分析师”
-
知识库问答
-
对话取数→输出(图表/看板/可编辑文件/报表...)
-
功能配置AI 助手
-
归因分析报告(AI 做总计)
以上这六种就是这几次交流中最高频出现的应用场景,和几个团队交流下来发现似乎还没出现超出这个范围的内容。就像之前大模型施工队的工程挑战这篇文章写的一样,研发团队实施 LLM,暂时看起来不存在门槛,因为依托的还是 LLM 本身的能力下限,大家能做出来一些不错的产品 demo 可以用来灰度。
场景 1-3 相对能做出来不错的效果,而有各种工程框架的支持,比如,去年下半年开始火热的 RAG,几乎成了所有做知识库问答团队的标配。场景 2 几乎可以直接划等号给 GPT4 的 code Interpreter (Advaned Analysis),这个场景也和两个团队交流过,到底它相比 GPT 原生的工具比有啥特殊的意义?可能的价值在于企业内部的安全方案考虑以及向内部用户搭建了一座通向 GPT4 的桥梁。
场景 4-6中,场景 4 基本是大家看到的面向用户最直接适用 LLM 的场景,当然这里还有一定的路线之争,后续专门讨论这个路径之争。场景 5 ,特点在于,LLM 是助手,过程的辅助,LLM 调用的和输出的,最终还是基于 BI 工具的表、图和看板。场景 6 因各家情况而异,有的团队是真的拿来写报告,包括取数+出图+文字,有的团队可能是只是用来写文字的这一层,但是就像场景 4 一样,不同的路线之争,反而会很有意思。
💥是为了追热点还是真实的生产环境产生作用?
这个问题是始终绕不开的,大家的出发点也都出奇的一致,有几个个核心的共识观点。
-
长期看是正确的,所以现在得试
-
试错的成本不高,所以可以做着
-
基本所有研发团队都在考虑怎么和 LLM 兼容

当然这种共识也要小心,可能非共识的东西才是正确的 。就像最近 CES 的明星产品 RabbitR1 一样。一边的共识觉得刚发布的 RabbitR1 没什么价值,而实际发生的事实却是每次都预定一空。哈哈,这段写跑题了。
至于是否真的在生产环境中起作用这件事儿,交流之后我的答案依然是不明确的。开放式答案的场景 ,应用上线和效率提升应该都是没问题的,比如知识库问答。但是有正确答案的场景 ,还是逃脱不了准确度的困扰,可用→不可不用 依然存在着不可逾越的鸿沟。上述场景 1-6 中,场景 1和3 是最好拿结果的,场景 3 和 4 是需要和既有工程深度结合的。场景 2 和场景 6,因人而已,因工具而异。
💥 AI 取数背后的两种路径之争?
取数是这几个团队都在做的核心场景,也是数据领域在使用 LLM 场景里的关键。虽然可能面向的用户不一样,但是LLM 能有效降低用户使用数据的成本。交流之后发现,这里的实施路径其实就两种:
-
NL2SQL,直接转化问题成 SQL,然后查询数据结果
-
NL+指标查询,NL 转化成维度、指标和修饰词,利用指标查询能力查数
后来才知道第二种方式的专业叫法是 NL2DSL,DSL 是指“领域特定语言”,Domain Specific Language。这两种方式当然是各有优劣,大家的工程和工具现状不同,所以选择的方式也不同。
核心的差异其实是先后顺序,AI 能力应该先规范后应用,还是应该先应用后规范 。如果是先规范再应用,或者当前数据已经规范的进入指标中台,那么选择 NL+指标查询的路径就会更合适。如果是先应用再规范,可能这数据底层或者数据建设还没那么完善,那么用 NL2SQL 则直接能借助 LLM 产生更大更直接的用处。

上述逻辑其实用 Kyligence 的一个分享中的图片就可以很好的解释,Kyligence 作为第三方数据产品,核心的产品逻辑就是指标中台。这个图片也很好的解释了他们的逻辑,可以借助指标中台进行数据的有序化和规范化,然后借助 AI 的能力去放大用户使用的价值。笔者之前专门使用过 Kyligence 的 Demo 产品,前半段成本较高,但是没有前半段,你就没法用好后半段的 AI 能力 。后续也会花时间专门写下第三方产品的逻辑。
💥 投入产出的衡量?
过程中,交流了一些大家常看的指标和借助 LLM 的量化收益。虽然会聊到具体的渗透率、满意度或者接口请求次数等微观层面的指标,但是大体上公司的态度是鼓励尝试,希望看看有哪些结合的点。
唯一的例外是那个商业化 BI的 团队 。他们的衡量标准很明确,无论是噱头也好,LLM 是否真的有帮助也好,只要 AI 功能能转化成用户买单的金额,这个功能就能立得住。因为收入是如此客观又准确,即使是用户买了尝鲜,实际没用,但又何妨呢?
最后想用两个彩蛋用来结束这个文章。第一个彩蛋是虽然在尝试国内外各种开源闭源的大模型,甚至还在微调,但是查数的两种路径下,GPT 的接口都要显著好于其他模型。第二个彩蛋是来自大家交流中提到的一个case,非常有趣。
在Chat 取数聊天框中,大家都会设置点赞和点踩的反馈按钮,如果单纯的依赖这个按钮看采纳率,数据能到 90% 以上,但是后续发现很多用户其实都不会去点那个按钮,所以这个数据在某种程度是失真的。
最后的最后非常感谢这几次交流的朋友,没想到在这个视频横飞的网络里,还能够以文会友,能够交流大家在做的事情。当然为了保密大家的身份,就不cue 大家了,期待和大家的下一次交流。🍻🍻🍻
