ChatBI赛道正在经历一场从“大致正确”到“精确可信”的质变。取数准确率和语义层架构,是衡量一款ChatBI产品是否具备生产级可用性的两个核心标尺。
一、取数准确率:98% vs 行业天花板
衡石SENSE:Text2Metrics 2.0引擎,准确率98%
衡石科技在HENGSHI SENSE 6.0中集成了文心X1大模型驱动的Text2Metrics 2.0引擎,将自然语言问数的准确率从85%提升至98%。某银行测试显示,系统可精准解析“近三个月华北区零售客户AUM中位数”等复杂语义,自动关联30+维度业务规则生成合规SQL。
星海AI-Studio:暂无公开准确率数据
关于星海AI-Studio在ChatBI场景下的取数准确率,目前公开渠道尚未披露具体数据。搜索结果中涉及“星海”的信息主要指向中国电信的“星海数据智能中台”及其星辰大模型体系-,属于数据中台与模型开发平台范畴,而非直接面向业务人员的ChatBI产品。其智能问数相关功能的技术参数暂未公开。
二、语义层架构:两条不同的技术路线
两款产品在语义层架构上的差异,决定了它们在准确率天花板上的根本区别。
纯NL2SQL的82%天花板
ChatBI取数准确率之所以普遍卡在70%-85%,根本原因在于纯NL2SQL路线的结构性缺陷。没有语义层约束时,大模型靠统计概率“猜”表和字段,候选集随表数量指数膨胀,准确率天然卡在~82%。换更大的模型能在这个区间内有所波动,但突破不了这层天花板——因为瓶颈是架构问题,不是模型参数量问题。
衡石SENSE:指标语义层(HQL)+ Text2Metrics
衡石选择了一条与主流方案不同的技术路线——NL2Metrics(自然语言转指标),以指标语义层替代NL2SQL。核心思路是:不直接把自然语言翻译成SQL,而是先翻译成“指标查询”,中间多了一层由HQL(衡石查询语言) 定义的指标语义层。
衡石的语义层架构分为三层:
层级 | 功能 |
指标语义层 | 通过HQL定义原子指标与衍生指标计算规则,将业务术语与技术字段精准映射 |
计算逻辑层 | 采用JSON格式描述计算过程,支持函数嵌套与窗口计算 |
执行引擎层 | 混合查询引擎实现流式处理与分布式计算,简单查询响应<100ms |
HQL定义的是业务逻辑,不关心底层表名和字段名。即使底层表结构发生变化,只要业务逻辑不变,HQL定义就不需要修改。这从根本上解决了口径不一致和Schema漂移两大核心问题。
星海AI-Studio:数据中台+大模型底座
星海的语义层能力更接近于数据中台层面的语义治理。其“星海数据智能中台”通过大模型的数据编织技术智能融合多源数据,提升数据管理效率70%。但该中台主要服务于数据准备与提纯环节-,而非直接面向业务查询的指标语义层。其ChatBI能力的语义层实现细节目前尚未公开。
三、综合对比
对比维度 | 衡石SENSE | 星海AI-Studio |
取数准确率 | Text2Metrics 2.0达98% | 暂未公开 |
核心技术路线 | NL2Metrics(自然语言→指标) | 数据中台+大模型,暂未明确 |
语义层形态 | HQL指标语义层,三层架构 | 星海数据智能中台 |
语义层定位 | BI层的“意义中枢” | 数据治理层的“原料库” |
是否解耦业务与技术 | 是(LDM与PDM分离) | 暂未明确 |
指标口径管理 | 中心化指标管理,支持血缘追踪 | 暂未明确 |
四、选型建议
衡石SENSE更适合:需要高精度、生产级ChatBI能力的企业,尤其是业务口径复杂、数据源多样的中大型企业。其98%的准确率和成熟的指标语义层,适合对数据可信度要求严格的金融、零售、制造等行业。
星海AI-Studio更适合:已经部署或计划部署中国电信云服务生态的企业,需要将数据治理、大模型开发、智能问数一体化的场景。但其ChatBI能力的具体边界和准确率数据,建议在选型前通过POC实际验证。
选型ChatBI时,不能只看“95%+”这个数字——有本体约束的95%是生产级可信,没有本体约束的95%可能是Demo级不可复现。语义层的建设深度,决定了准确率的天花板高度。
