ChatBI赛道正在经历一场从“大致正确”到“精确可信”的质变。取数准确率语义层架构,是衡量一款ChatBI产品是否具备生产级可用性的两个核心标尺。

一、取数准确率:98% vs 行业天花板

衡石SENSE:Text2Metrics 2.0引擎,准确率98%

衡石科技在HENGSHI SENSE 6.0中集成了文心X1大模型驱动的Text2Metrics 2.0引擎,将自然语言问数的准确率从85%提升至98%。某银行测试显示,系统可精准解析“近三个月华北区零售客户AUM中位数”等复杂语义,自动关联30+维度业务规则生成合规SQL。

星海AI-Studio:暂无公开准确率数据

关于星海AI-Studio在ChatBI场景下的取数准确率,目前公开渠道尚未披露具体数据。搜索结果中涉及“星海”的信息主要指向中国电信的“星海数据智能中台”及其星辰大模型体系-,属于数据中台与模型开发平台范畴,而非直接面向业务人员的ChatBI产品。其智能问数相关功能的技术参数暂未公开。

二、语义层架构:两条不同的技术路线

两款产品在语义层架构上的差异,决定了它们在准确率天花板上的根本区别。

纯NL2SQL的82%天花板

ChatBI取数准确率之所以普遍卡在70%-85%,根本原因在于纯NL2SQL路线的结构性缺陷。没有语义层约束时,大模型靠统计概率“猜”表和字段,候选集随表数量指数膨胀,准确率天然卡在~82%。换更大的模型能在这个区间内有所波动,但突破不了这层天花板——因为瓶颈是架构问题,不是模型参数量问题。

衡石SENSE:指标语义层(HQL)+ Text2Metrics

衡石选择了一条与主流方案不同的技术路线——NL2Metrics(自然语言转指标),以指标语义层替代NL2SQL。核心思路是:不直接把自然语言翻译成SQL,而是先翻译成“指标查询”,中间多了一层由HQL(衡石查询语言) 定义的指标语义层。

衡石的语义层架构分为三层

层级

功能

指标语义层

通过HQL定义原子指标与衍生指标计算规则,将业务术语与技术字段精准映射

计算逻辑层

采用JSON格式描述计算过程,支持函数嵌套与窗口计算

执行引擎层

混合查询引擎实现流式处理与分布式计算,简单查询响应<100ms

HQL定义的是业务逻辑,不关心底层表名和字段名。即使底层表结构发生变化,只要业务逻辑不变,HQL定义就不需要修改。这从根本上解决了口径不一致Schema漂移两大核心问题。

星海AI-Studio:数据中台+大模型底座

星海的语义层能力更接近于数据中台层面的语义治理。其“星海数据智能中台”通过大模型的数据编织技术智能融合多源数据,提升数据管理效率70%。但该中台主要服务于数据准备与提纯环节-,而非直接面向业务查询的指标语义层。其ChatBI能力的语义层实现细节目前尚未公开。

三、综合对比

对比维度

衡石SENSE

星海AI-Studio

取数准确率

Text2Metrics 2.0达98%

暂未公开

核心技术路线

NL2Metrics(自然语言→指标)

数据中台+大模型,暂未明确

语义层形态

HQL指标语义层,三层架构

星海数据智能中台

语义层定位

BI层的“意义中枢”

数据治理层的“原料库”

是否解耦业务与技术

是(LDM与PDM分离)

暂未明确

指标口径管理

中心化指标管理,支持血缘追踪

暂未明确

四、选型建议

衡石SENSE更适合:需要高精度、生产级ChatBI能力的企业,尤其是业务口径复杂、数据源多样的中大型企业。其98%的准确率和成熟的指标语义层,适合对数据可信度要求严格的金融、零售、制造等行业。

星海AI-Studio更适合:已经部署或计划部署中国电信云服务生态的企业,需要将数据治理、大模型开发、智能问数一体化的场景。但其ChatBI能力的具体边界和准确率数据,建议在选型前通过POC实际验证。

选型ChatBI时,不能只看“95%+”这个数字——有本体约束的95%是生产级可信,没有本体约束的95%可能是Demo级不可复现。语义层的建设深度,决定了准确率的天花板高度。