数智前沿观察系列④:人工智能就绪数据是“模数共振”的关键所在

首页    创见    数智前沿观察系列④:人工智能就绪数据是“模数共振”的关键所在
图片
 
 

字数:4k+

图源:即梦AI

 

数据从原始资源转变为新型生产要素,人工智能从前沿技术加速跃升为现实生产力,并向“DATA+AI”、“DATA×AI”共生生态深化演进,“数智飞轮”加速引领全球数字浪潮。以高质量数据为内核、以智能技术为引擎、以“数据即AI、AI即服务”为价值闭环的“数据智能”新赛道迅速崛起,有望释放出前所未有的巨大潜能。为进一步探究其发展趋势变革,上海中创产业创新研究院推出“数智前沿观察”研究系列,为数智经济发展提供决策参考。

 

2026年4月工信部、国家数据局联合印发《关于联合实施2026年“模数共振”行动的通知》,提出面向钢铁、石化、工业母机、汽车、医疗装备等20个重点行业领域,通过行动构建“数据-模型-场景应用”良性互促的循环,推动人工智能高水平赋能新型工业化。“模数共振”准确描述了高质量数据与高效能AI模型之间相互依存、同频共振的“双螺旋”进化关系。一方面,高质量数据是驱动模型迭代的关键燃料;另一方面,模型也反过来引导和数据治理与优化,两者从传统“单向赋能”走向“伴生进化”深度融合。

 

 

然而,从大模型应用落地实践来看,随着模型参数规模的持续扩大和算力资源的不断堆砌,大模型能力越来越强,但对提升生产效率、赋能行业升级的作用却仍不及预期,面临“模型空转、数据沉睡、场景脱节”的发展困境究其原因,缺少人工智能就绪(AI-Ready)的高质量数据正成为制约AI价值释放的核心瓶颈。据麦肯锡调研显示,70%的AI项目未能达到预期商业目标,其中数据问题占比高达45%;Gartner预测,2026年60%的AI项目将因缺乏AI就绪数据而被放弃。由此可见,数据就绪能力正在取代模型选型成为企业智能化的关键一步,未来企业将加速从“卷模型”向“卷数据”转变,没有人工智能就绪的高质量数据,企业就无法获得真正的AI竞争力。

 

图片

图片
图片
以数赋模:
高性能模型到底缺什么数据
 

当前,大模型的核心能力正在向多模态(Multimodal)、智能体(Agentic abilities)、复杂推理(Complex Reasoning)和高阶编程(Advanced Coding)聚焦,对训练数据的需求也从原来以海量互联网公开数据为主,转向高知识密度、高场景关联、多模态融合、强任务推理的高质量数据。具体来看,目前制约模型性能提升的数据缺口主要体现在五个方面:

 

一是缺行业高知识密度数据。传统基模训练高度依赖网页文本等通用语料,但缺乏覆盖工业机理、行业术语的专业化、权威性知识库。例如,医疗领域需整合临床指南、医学影像报告与诊断逻辑的关联数据,但现有数据集多为孤立文本,缺少结构化标注的“技术机理链”。在这方面,美国医疗科技企业OpenEvidence给出了成熟案例,通过与《新英格兰医学杂志》《美国医学会杂志》建立内容合作关系,合法使用大量受版权保护、经过严格同行评审的黄金标准级医学内容进行模型训练,形成“结论-证据-文献”的完整循证链条,支撑160个专科、1000余种疾病的跨学科查询,单月支持约1800万次来自美国认证医生的临床咨询,美国超过40%的医院和医疗中心医生每天使用该平台。

 

OpenEvidence的数据产品解决方案(图源:OpenEvidence官网)

 

二是缺多模态对齐数据。随着大模型向原生多模态进化,需要的不再是割裂的文本/图像/视频/音频数据,而是“精准描述+任务指令+结果解释”相结合的跨模态对齐数据。例如美国癌症精准医疗科技公司Tempus,通过自采(自有检测服务沉淀基因组、转录组等分子数据)、链接(对接3000+医疗机构EHR 系统,采集电子病历、用药记录、疗效随访等临床数据)、并购(通过收购Ambry获取40万份遗传数据,收购Paige获得700万张病理切片数据)等方式,形成 “DNA+RNA +影像+病理+临床”的全模态数据资产,与超过3000家医院建立合作关系,覆盖全美65%的学术医疗中心和50%的癌症医生。2025年实现营收约12.7亿美元,同比增长83%。

 

三是缺长尾稀缺数据。由于长尾数据(如医疗领域罕见病描述仅占医学文献0.3%以下,但实际诊疗中需100%覆盖)和Corner case数据(自动驾驶中0.01%的极端场景导致了72%的致命事故)在真实世界中天然较为稀少、采集成本高且隐私限制严苛,导致模型在罕见场景下性能断崖式下跌,甚至产生高风险幻觉。为此,通过定向采集、场景挖掘和仿真合成构建长尾稀缺数据集,成为不少智驾模型厂商的必选项。例如,比亚迪通过310万辆搭载天神之眼智能辅助驾驶的车辆,每天生成2亿公里数据,覆盖城市拥堵、乡村小道、高速巡航、雨雪天气等数千个长尾场景;小鹏汽车通过定向采集和仿真结合,一年内累计解决1000个以上Corner case(极限场景),高速NGP事故率降低95%。

 

比亚迪“天神之眼”系统(图源:新浪财经)

 

四是缺生产伴随数据。大模型和智能体要真正在行业应用中落地,就要从训练“阅读理解”向训练“决策执行”转变,而人类在科研、生产过程中的决策、交互、偏好、纠错、长链条任务示范等真实过程数据,往往是缺少记录和积累的。在具身智能领域,国内外企业对生产伴随型数据的需求最为迫切。例如,京东发动60万人计划在两年内积累1000万小时真实场景视频数据,同时通过仿真平台批量生成高逼真数据,弥补罕见场景空白。

 

五是缺真实物理表征数据。当前,世界模型的热度持续上升,但仍处在概念较为混乱、多技术路线并行阶段。李飞飞在最新研究文章中将世界模型划分为渲染器(输出观测,根据用户输入实时生成高视觉保真画面)、模拟器(输出状态,使人机交互符合几何、物理或动力学规律)和规划器(输出动作,让系统能够在非结构化的世界中决定机器人应该做什么)三个类别。但这三个类别并非彼此割裂,而是共享同一套关于世界如何运作的底层知识。例如,阿里最新发布的Happy Oyster 3D世界模型,可生成具有物理一致性的可探索三维世界,与Happy Horse视频生成模型共同形成视频与三维世界协同的世界模拟器布局。

 

阿里Happy Oyster(图源:知乎账号“德里克文”)

 

图片
图片
以模治数:
如何提高数据的人工智能就绪度
 

随着大模型技术的不断迭代升级,也为打造人工智能就绪数据提供了技术手段,使得数据自动化治理、多模态数据融合、复杂场景数据解析等成为可能。

 

在数据采集阶段,从静态采集到实时汇聚。传统数据往往按照一定时间频率(日、周、月、年等),依赖人工爬取或表单录入进行采集,数据多为静态和截面数据。而随着模型落地真实生产场景后,依托工业传感器和工业软件,全流程生产行为、设备运行、人工操作将会进行实时有效汇聚,为模型优化迭代提供新鲜血液。

 

在数据生产阶段,从原始数据到合成数据。针对由于数据稀缺、隐私问题和高成本带来的专业数据难以获取问题,通过大模型生成高保真合成数据,不仅可应用于长尾、稀缺数据的生成,也有助于提升高价值数据的获取效率。未来发展方向是合成数据与真实数据的融合应用,即一方面利用真实数据校准合成数据的分布,另一方面利用合成数据扩展真实数据的覆盖,共同支撑高性能模型的训练。

 

在数据清洗阶段,从规则匹配到语义理解。传统数据清洗通过人为设定规则来进行数据分类、筛查和清洗。而运用大模型,不仅可以根据语义指令来自动识别低质量、有毒或虚假内容,还能基于语义清洗形成更有价值的数据。例如,谷歌使用Gemini深度梳理了全球500万篇新闻报道,并提取出260万次洪水事件记录,将定性描述转化为带有地理标签和时间戳的定量数据,形成了山洪预警数据集。

 

谷歌使用Gemini预测山洪(图源:IT之家)

 

在数据标注阶段,从平面标注到多模态关联标注。传统数据标注基于特征识别进行无差别标注,主要依赖人工标注,且标注内容相对单一固定(如图像框选)。而随着大模型技术的加持,已经能够对文本-图像-知识图谱等进行联动标注,并实现对复杂场景语义的理解。例如,自动驾驶厂商运用Amazon Nova多模态大模型,能够自动分析天气、道路类型静态信息车辆轨迹、行人动作动态信息,并生成结构化语义标签(如暴雨天+城市道路+车辆急刹等),无需人工补标

 

Amazon Nova多模态嵌入模型(图源:知乎账号“亚马逊云科技”)

 

在数据应用阶段,从一次性消耗到持续反哺迭代。传统数据在模型上线后往往停止优化,如果数据更新则需要对模型进行重新训练。而通过构建大模型应用的全局反馈管线,能够记录模型应用中出现的预测偏差、决策失误、适配漏洞,定向补充缺失样本、优化模型参数,完成新一轮迭代升级。
图片
图片
模数共振:
加快释放人工智能的行业应用价值
 

综上所述,推动“模数共振”应当人工智能就绪数据作为核心要素,从追求更复杂的模型架构,转向构建标准化、体系化、可迭代的高质量数据,系统性提升数据质量、嵌入领域知识、重构数据生命周期管理,实现数据与模型的协同优化,为AI应用落地提供稳定、可控、可规模化的支撑。

 

一是构筑行业高质量数据底座。“一业一策”统筹建设通识公共数据集与场景专识数据集,由行业龙头企业联合科研院所牵头梳理行业通用工艺、设备标准、基础参数形成通识数据集,面向全行业开放共享;各企业立足自身核心产线,归集细分场景生产数据、老专家经验等打造专属专识数据集,定向支撑自有专用模型迭代。逐步形成我国工业领域国家级数据底座,助力传统制造业向智能制造转型升级。

 

二是重构行业数据治理体系。传统大数据时代,提取(Extract)、转换(Transform)、加载(Load)成为核心的数据集成和处理方法。而进入人工智能时代,面向“采洗标测用”全链条的数据治理方法论和技术工具均面临重构,从源头生产伴随式采集过程型、推理型、交互型、正负样本数据,依托AI自动标注技术降低数据治理成本,到运用数据合成技术弥补细分场景专识数据短缺问题,再到通过隐私计算、联邦学习实现跨主体数据联合训练等至关重要。

 

三是建设“模数共振”实训场。聚焦重点行业领域打造“模数共振”实训场或中试基地,组织行业龙头企业、算力企业、模型企业、数据企业和应用开发企业共同参与,联合开展模型研制、软硬适配、数据处理、应用方案设计与开发,探索形成行业级解决方案,打造人工智能赋能行业“样板间”。

 

四是培育专业化数据治理生态。针对传统制造企业数据治理缺人才、缺技术等难题,加快培育专业化第三方数据治理服务商,面向传统制造企业、中小企业输出标准化数据归集、治理、标注服务;依托产学研联动机制,推动高校、科研院所与制造企业共建行业数据集,促进上下游数据共享

 

五是完善人工智能就绪数据标准。目前,我国正在积极推动高质量数据集标准体系建设,而人工智能就绪度应当成为衡量高质量的核心要素。具体可以从数据就绪度(数据在全生命周期各环节的准备程度)、对象就绪度(数据对基础模型、垂类模型、智能体的适配程度)、场景就绪度(数据在不同行业场景中的价值实现程度)、价值对齐度(确保数据与系统目标、行为及人类价值观保持一致)等维度,构建人工智能就绪度评价体系,为高质量数据集建设提供指引。
 

参考资料:

1.《关于联合实施2026年“模数共振”行动的通知》,工信部、国家数据局,2026年4月。

2.麦肯锡全球AI调研:企业AI部署现状,McKinsey Greater China。

3.Lack of AI-Ready Data Puts AI Projects at Risk,Gartner,2025.02.26。

4、今年最火的AI医疗增长神话,中国能复制吗?动脉网,2025年12月02日。

5、Tempus AI:人工智能推动精准医疗,未央网,2025年3月3日。

6.李飞飞最新长文:当视频生成、机器人和NVIDIA都自称世界模型,我们需要一个分类法,加洋,DeepTech深科技,2026年6月4日。

 

图片

- E N D -

编辑:龙彦霖

 

 

2026年6月8日 14:55
浏览量:0
收藏