摘要:CORTEX 框架集语料精炼与知识组织于一体,用知识蒸馏把前沿大模型评估能力压到0.3B学生模型(千倍压缩),并构建本体语料图支持跨域精准取数。
大模型训练最贵的隐性成本之一,是"找好数据"。CommonCrawl 这类 Web 语料规模庞大,却混着低质量、重复和有害内容;用前沿大模型做多维质量评估最准,但超大规模语料直接用成本又高得离谱。EMNLP 2026 的 CORTEX 框架就是冲着这个痛点来的,它把"高质量语料精炼"和"知识组织"合二为一。

方法分三层。数据预处理从原始 Web 数据提取正文和元数据,做语言过滤和全局去重;质量精炼用知识蒸馏把 GPT-5 级的多维评估能力压到一个仅0.3B的学生模型(约千倍压缩),再从文档级和句子级两个粒度筛出高质量数据;最后构建"本体语料图(OCG)"——自动化生成本体,把扁平文档升华为带跨域关联的知识图谱。实验结果很硬:三个质量评分模型对目标类别的召回率都超过95%,而评估成本被砍到可忽略;基于中文 CommonCrawl 快照,从约26.1亿网页精炼出241.4亿 Token 高质量语料。
我的判断:CORTEX 的价值在"按需取数"。预训练、后训练、领域模型对数据的粒度和领域要求各不相同,传统方法产出的仍是扁平文档集,难满足定制化需求。OCG 支持任意领域粒度及其关联领域的精准抽取,还能做跨域数据合成(CORTEXBENCH 已生成917道高难度 QA)。这对中小团队尤其友好——不用养一支昂贵的数据标注和评测队伍,也能拿到结构化的高质量训练原

