每日推荐
首页 > 理论 > 正文

具身智能高质量数据集建设的法治护航

【摘要】具身智能已从实验室的前沿探索加速迈向产业化,高质量数据集是驱动这一产业发展的关键基础设施。我国具身智能高质量数据集建设,在数据供给、技术工具、标准规范、安全合规、商业模式等方面仍存在不少困难与挑战。为有效应对具身智能高质量数据集建设面临的法治挑战,可从合规获取、安全共享和利益分配三个关键环节出发,提出针对性的制度应对方案,通过明确数据权属、规范数据流通、激励数据共享,破解具身智能高质量数据集建设难题,为具身智能产业提供数据支撑。

【关键词】具身智能  人工智能  高质量数据集  智能经济   

【中图分类号】D92    【文献标识码】A

人工智能作为引领新一轮科技革命和产业变革的关键技术,正从“离身智能”向“具身智能”加速演进。根据智能体是否拥有物理身体、是否与真实环境直接交互,人工智能被划分为离身智能(Disembodied AI)与具身智能(Embodied AI)两条发展路径。具身智能通过“身体—环境”交互构建动态闭环学习机制,突破离身智能依赖静态数据表征的局限,成为实现人工智能向更高级阶段发展的关键路径。但具身智能的产业化面临核心数据瓶颈——高质量数据集的匮乏与建设不足。

“十五五”规划纲要提出,“加快突破人工智能基础理论和核心技术”,“鼓励多模态、智能体、具身智能、群体智能等技术创新”,“面向能源、交通、制造、教育、健康、金融等领域建设高质量数据集,建立人工智能训练数据合理使用制度”。①具身智能已从实验室的前沿探索加速迈向产业化,高质量数据集是驱动这一产业发展的关键基础设施。

具身智能高质量数据集的主要特征

具身智能作为人工智能从数字空间走向物理世界的重要形态,其对高质量数据的需求和要求区别于传统人工智能。

具身智能与离身智能。具身智能被定义为一种智能系统,其能够通过其物理形态与环境进行互动,利用感知系统收集信息,并通过认知处理,实现对环境的理解和行为的决策。具身智能可突破传统智能依赖静态数据表征的局限,是实现人工智能发展目标的关键路径;离身智能主要依赖封闭、仿真或互联网收集的数据训练模型,基于静态数据分布,可移植性与可扩展性差,难以适应真实物理世界。②具身智能是对传统智能的延伸与发展,通过“身体—环境”交互构建与现实世界动态交互的闭环学习机制,解决传统智能在复杂、动态、不确定物理环境中适应性问题,传统智能是具身智能发展的基础,具身智能则聚焦物理交互与动态适应能力,推动人工智能向更高级阶段演进。

数据集与高质量数据集。人工智能数据集旨在为机器学习模型提供必要的训练资料,其包含大量标注的图像、文本、语音等数据样本,这些样本用于训练人工智能系统识别和学习各种特征模式。③通常而言,一个数据集主要由4个部分构成——特征、标签、元数据以及样本。高质量数据集相较于一般数据集具有以下特性:一是高质量数据集数据信噪比处于较高水平,有效信息占比显著高于冗余信息,能有效规避各类“脏数据”对后续研究的干扰。二是交付形态更丰富,除数据集或数据接口外,还附带包含应用场景、数据模态等信息的说明书,强调产品的可理解、可信赖与可复用。三是功能定位不同,传统数据产品侧重于提供查询分析结果,而高质量数据集是为人工智能模型提供训练所需的原材料或半成品,旨在赋能模型自身获得能力提升。因此,除具备质量可评估、价值可流通、合规可监管等基本特征外,高质量数据集产品还需额外满足内容可理解的要求。

然而,上述界定主要立足于技术视角。在具身智能场景中,数据不仅服务于模型的识别、预测和生成,而且直接影响物理行动和现实后果。因此,对“高质量”的理解应当从技术维度扩展至制度维度。具身智能场景下的高质量数据集应具备四重制度属性:其一,真实性,即数据能够较为充分地反映真实环境中的任务条件与反馈关系;其二,可追溯性,即数据来源、采集方式、处理链条和标注过程可被核验;其三,合规性,即数据的采集、处理、共享和使用具有合法依据,并符合目的限定、最小必要和比例原则;其四,安全性,即数据本身及其所支撑的模型部署,不会引致不可接受的隐私侵害、安全失控或现实风险。

具身智能对高质量数据集的特殊要求。具身智能“身体—环境”交互的特性,赋予其“物理场景适配性”“多模态动态性”“高采集成本”等独特要求。这种“一般性基础上的特殊性”,决定了解决具身智能高质量数据集建设问题,既需遵循数据集建设的一般逻辑,又需应对物理交互带来的新问题——静态规则难以适配动态场景,统一标准难以覆盖多模态数据。相较于离身智能,具身智能对高质量数据集的需求,呈现以下特殊性。

数据内容不同。大模型训练主要以文本、音视频等多模态数据为主,这类数据侧重于信息层面的表征与理解,数据内容更集中于从海量互联网数据中学习知识、语义和模式,其数据采集与构建主要围绕信息维度的丰富性和多样性展开,旨在支撑模型对既有信息的分析与处理能力,无需涉及与物理世界的直接交互。而具身智能的训练所需数据以真实物理场景为核心。因此,除了上述数据,还包括与物理世界互动的数据。以训练数据采集方式为标准,具身智能训练所需数据可以分为三类:真机采集数据、仿真合成数据、互联网数据。

收集难度不同。高质量具身数据的收集更加困难,这是因为具身数据本身构成复杂,包含“具身大脑数据”和“具身小脑数据”两部分,共同驱动机器人“感知—规划—决策”闭环,其复杂性远超文本语料。在具身大脑侧,数据需要覆盖视觉、语言与任务规划等长序列多模态信息,不仅依赖真实场景的大规模采集,而且需手工或半自动构造多样化标注。在具身小脑侧,数据关注关节位置、力触觉等精细操控轨迹,真机采集依赖遥操作、动作捕捉等途径,受人力与设备约束,规模化成本高、效率低。④

在不同环节面临不同的数据处理难题。在数据采集环节,面临真实数据采集成本高、效率低的问题,依赖场景搭建、专业设备和专家示教,且需确保数据适配实际任务需求。同时,仿真数据虽采集效率高,但质量不足以支撑可靠的行为学习和真实场景泛化,数据规模也未达到支撑模型高性能的要求。在数据处理环节,不同真机平台或采集设备的数据在格式、精度等方面差异大,难以有效共享;仿真平台数据格式、坐标系等也不一致,整合困难。数据标注的精细度、视觉信息处理内容和采样频率也可能不一致,增加了处理难度。在数据使用环节,需找到高效的数据训练策略,尽快让模型跨越“演示”阶段并部署到真实场景中。

数据质量评估方法不同。传统数据质量评估方法,通常侧重于规范性、准确性、完整性、一致性、时效性、可访问性等基础性技术指标,这在常规任务中具有一定的参考价值,但难以覆盖特定应用场景下对于实用性、公平性、偏差控制、可扩展性等更高阶的质量评估需求。

数据品质与任务需求之间存在结构性错位。具身智能的任务是实现真实物理环境中的感知、决策与执行,其训练数据不仅需要标准化的动作轨迹,而且需覆盖丰富的失败样本、环境扰动样本与跨场景迁移信息。然而,现有数据集多偏向静态化、理想化的样本构成,与真实场景任务需求之间存在显著错位。这种错位导致模型训练与落地应用脱节,进入真实环境部署时极易出现动作失真、泛化能力不足等问题。

具身智能高质量数据集建设面临的法治挑战

我国具身智能高质量数据集建设,在数据供给、技术工具、标准规范、安全合规、商业模式等方面仍存在不少困难与挑战。

合规获取难题:物理场景数据采集存在授权难题。具身智能高质量数据集建设的合规获取难题,具体体现在家庭场景、工业场景和公共场景的数据获取上。家庭场景数据获取的关键矛盾是“隐私边界与知情同意的场景化”。具身智能机器人进入私人空间采集数据时,需突破传统“一次性授权”的局限。例如,机器人可能在客厅采集环境数据,却在卧室意外捕捉到个人隐私信息,此时需根据具体场景,动态调整授权范围。但现有法律对“场景化动态授权”缺乏明确规则,导致知情同意原则难以适配具身智能的复杂交互场景,隐私边界模糊。

工业场景数据获取的关键问题是“设备数据权属的多方博弈”。工业机器人采集的设备运行数据,涉及企业(数据控制者)、设备制造商(数据生产者)、操作工人(数据关联主体)等多方主体。以工厂设备产生的振动、温度数据为例,企业可能主张其作为设备所有者拥有数据权,制造商则认为数据属于设备固有属性,工人可能主张数据包含其操作习惯。权属不清导致授权链条断裂,企业难以合法获取或共享数据,制约数据集建设。

在公共场景数据的利用方面,政务数据开放已经取得显著发展,但在高价值数据利用与数据质量保障方面仍存在痛点。一是高需求数据开放不足。高新技术企业、医疗机构、企业注册登记等高下载、高利用数据集,在全国地方平台的开放比例多在40%及以下。⑤二是接口调用问题多。时效性高的API接口较少,仅浙鲁粤等少量省市能每天更新,不少无条件开放接口存在申请无响应、说明不清晰、无法调用、数据不更新等问题。三是可获取性与及时性差。部分标为“无条件开放”的数据,却需申请或设重重限制,甚至无法打开,部分平台出现数据中断供给现象。

安全共享难题:跨本体数据协同的机制缺失。跨本体数据协同需突破标准、信任与技术三大障碍。标准壁垒源于具身智能多模态数据的异构性:视觉、力觉、文本等数据格式,缺乏统一规范,不同厂商的机器人采集数据难以直接互通,导致数据共享时需额外转换成本,甚至因格式不兼容而重复采集,加剧数据孤岛。标准缺位的深层后果是“质量不可证”与“流通不可通”。前者意味着,缺乏统一行业标准的情况下,不同主体对“高质量”的判定尺度各不相同,企业内部自定的采集规范和质量要求无法获得全行业普遍认可,数据质量参差不齐、难以核验;后者意味着,缺乏统一的数据格式规范和标注标准,不同主体采集的数据集复用成本高,高价值数据难以转化为行业公共资源。

信任成本表现为数据贡献与模型收益不对等。数据提供方(如中小企业、场景运营方)担心数据被滥用或“搭便车”,大企业可能利用共享数据,训练出高性能模型,却未将收益反哺数据贡献者,导致数据提供方缺乏共享动力。贡献与收益的失衡,使得跨本体数据协同难以形成良性循环。

技术瓶颈在于联邦学习在多模态物理数据中的适用局限。联邦学习虽能实现数据“可用不可见”,但具身智能的多模态物理数据具有高实时性、低延迟需求,而传统联邦学习的通信效率与模型同步机制难以适配。

利益分配难题:数据要素价值化的激励失衡。具身智能数据集建设中的利益分配难题,主要是数据要素价值化过程中激励机制的失衡,具体体现为数据垄断、贡献量化困难与收益反哺缺位。对于数据垄断,大厂商可能凭借技术、资金优势,垄断真机采集数据,如工业机器人的力触觉数据、家庭机器人的环境交互数据,形成“数据壁垒”。中小创新者因缺乏数据资源,陷入“数据贫困”,难以训练出高性能模型,只能依赖仿真数据,导致模型泛化能力不足。

贡献量化的难点在于不同类型数据的价值评估。具身智能数据包括真机数据(高成本、高稀缺性)、仿真数据(低成本、可扩展性)和标注劳动(人工成本)。真机数据因采集难度大、场景覆盖广,价值远高于仿真数据,但在缺乏较为公正的价值衡量标准的情况下,其高昂的采集成本与长尾场景的潜在价值往往难以转化为合理的市场价格,导致真机数据的优质供给方在高投入、低回报的预期下降低数据供给的热情。仿真数据在训练中较容易获取,却可能因供给量大且价格低廉的优势掩盖其自身固有的欠缺物理真实性的局限,导致其真实贡献难以量化,价值难以准确评估。与此同时,高度专业化的标注劳动的价值则需考虑标注精度、复杂度等因素,但常被简单锚定为体力型人工成本,忽略其中蕴含的专家经验价值。

收益反哺机制缺位,导致场景提供方缺乏共享动力。场景提供方为数据集建设,提供了物理场景和数据资源,同时承担保证数据安全性与隐私性的压力,以及物理资产损耗等显著的负外部性成本,但在数据要素转化为高溢价的模型或者服务后,产生的数据运营收益与服务红利,如模型授权费、数据服务费等,却因利益分配机制的缺位而未回馈至场景提供方。在利益错配的影响下,场景提供方缺乏数据流动的动力,可能导致高质量数据供给链条难以成型甚或断裂。

具身智能高质量数据集建设的法治应对

为有效应对具身智能高质量数据集建设面临的法治挑战,可从合规获取、安全共享和利益分配三个关键环节出发,提出针对性的制度应对方案,破解具身智能高质量数据集建设难题。

合规获取的法治保障:分层授权与场景化规则。针对物理场景数据采集的授权难题,需通过数据分类分级、动态知情同意及公共数据开放机制,构建分层授权与场景化规则体系。在数据分类分级层面,依据《中华人民共和国个人信息保护法》《中华人民共和国数据安全法》等法规的风险评估要求,按物理场景的敏感程度实施差异化管理。例如,家庭场景数据风险较低,可采用“概括授权+场景限定”模式,用户同意后允许机器人采集特定区域数据;工业场景数据涉及商业秘密,需经企业内部审批及数据安全评估,限制数据采集范围与使用目的。

在知情同意机制健全方面,需突破“一次性授权”局限,建立“场景化动态授权”模式。通过地理围栏、行为识别等技术,实时监测机器人活动场景,当场景变化时,自动触发授权调整,用户可通过APP接收通知并确认。同时,明确告知数据采集的具体内容、用途及存储期限,确保同意的真实性与动态性。可配合隐私计算沙箱,数据在加密状态下被调用,实现平台“用数不见数”,个人“授权即放心”。

针对工业场景数据权属博弈的难题,需明确工业场景数据权属规则,依据“谁采集、谁负责,谁投入、谁受益”的原则,界定企业(数据控制者)、设备制造商(数据生产者)、操作工人(数据关联主体)的权利边界——设备运行基础数据归制造商所有,企业基于设备使用产生的衍生数据归企业所有,操作工人的操作习惯数据需获得其同意后方可使用,避免权属模糊导致的授权断裂。在公共数据开放层面,明确政务场景数据的授权运营边界,通过政府数据开放平台发布“数据开放授权协议”,规定数据使用范围、运营主体及合规义务。

安全共享的制度创新:推动跨本体数据协同治理。针对跨本体数据协同的机制缺失,需通过标准强制互认、数据信托机制与开源社区治理,构建数据协同治理体系。在标准强制互认方面,可依托国家地方共建人形机器人创新中心(以下简称“创新中心”),破解数据格式壁垒。当前具身智能数据因厂商“各自为政”,存在视觉、力觉等多模态数据格式不互通问题,导致数据割据。创新中心可牵头制定行业统一标准,如具身智能多模态数据采集与存储规范,明确视觉、力觉、关节轨迹等多模态数据的格式、精度、标注标准;推动标准强制互认,将数据格式合规纳入企业政策扶持、资质认定的考核范围,对符合标准的企业给予资金补贴。在数据开放方面,推动具身智能系统的数据共享与标准化,积极参与国际标准制定工作。

在构建数据信托机制方面,可通过第三方托管与审计降低信任成本。针对数据贡献与模型收益不对等的问题,可设立独立数据信托机构,如具备数据安全资质的信托公司,负责数据托管、加密及使用审计。数据提供方将数据托管后,模型训练方可通过信托机构获取“可用不可见”的数据使用权,信托机构记录数据使用情况,为后续收益分配提供依据。同时,信托机构需定期审计数据使用合规性,如是否超出授权范围,保障数据提供方的权益,解决贡献与收益失衡的问题。

针对联邦学习在多模态物理数据中的技术瓶颈,推动技术迭代,研发低延迟、高实时性的联邦学习框架,适配具身智能的动态交互需求;鼓励企业联合科研机构,探索“仿真数据+真机数据”的混合联邦学习模式,降低真机数据共享的成本与风险;在家庭、工业等重点场景,试点部署边缘计算与联邦学习结合的技术方案,减少数据传输延迟,提升模型更新效率。

在开源社区治理方面,推动开源数据集繁荣发展,各方共同加入开源生态,推动开源数据与具身智能发展深度融合,使开源成为驱动科技创新与产业升级的重要引擎。

利益平衡的公平竞争秩序:构建梯度化治理框架。针对数据要素价值化的激励失衡,单一的法律工具难以胜任。反垄断法虽能规制数据垄断行为,但其适用门槛高,相关市场界定、市场支配地位认定等程序复杂、周期漫长,待整套程序走完,高质量数据集的共享需求可能早已错过产业发展的窗口期。因此,可构建协商优先、规制兜底的梯度化治理框架,综合运用协商许可、反不正当竞争法规制、反垄断法规制三种工具,实现从柔性引导到刚性约束的制度衔接。

首先,可有条件地借鉴标准必要专利领域的公平合理非歧视(Fair,Reasonable,and Non-Discriminatory,FRAND)许可理念,建立数据集授权许可机制。数据与专利在权利性质上存在差异,FRAND义务并非数据持有者的天然义务。对于一般性商业数据集,应以鼓励协商为主,避免强制性的FRAND义务过度干预市场自治。然而,对于获得政府公共资金支持形成的数据集,或在事实层面已形成行业依赖的私有、关键的高质量数据集,可参照标准必要专利(Standard Essential Patent,SEP)领域的许可原则,要求数据集持有者以公平合理无歧视的条件向第三方开放许可。该模式的关键在于“先谈后判”,鼓励当事方通过协商达成许可协议,仅在协商不成时才启动仲裁或司法程序。这一路径的优势在于:其一,启动门槛低于反垄断审查,无需事先完成复杂的市场支配地位认定;其二,尊重市场主体的意思自治,通过协商形成符合双方利益的许可条件;其三,效率更高,能够快速响应产业发展的数据需求。具体制度设计上,可依托国家数据部门或行业主管部门建立数据集许可争议的调解与仲裁机制,制定数据集FRAND许可的参考指引,明确许可费的合理计算方式(如成本加成、价值分摊、收益分成等模型)。

其次,发挥反不正当竞争法的兜底保护功能,防范数据滥用行为。在协商机制无法达成合意的情况下,应充分运用《中华人民共和国反不正当竞争法》增设的数据保护工具。对于头部企业以技术手段拒绝开放、但尚未构成垄断的行为,可依据第十三条第三款主张其构成不正当竞争。此外,在数据领域,即使大型企业等经营者尚未达到市场支配地位的标准,但其在特定数据资源上具有相对于交易对方的优势地位,若以此拒绝开放或设置歧视性条件,亦可基于规范目的将该行为解释为《中华人民共和国反不正当竞争法》第十三条第三款所规制的范畴。相较于反垄断法,反不正当竞争法的适用门槛更低、程序更灵活,能够在中观层面填补反垄断法与协商机制之间的制度空白。

再次,以反垄断法为最终保障,规制极端数据垄断行为。当上述两种路径均无法解决数据垄断问题时,反垄断法应发挥兜底规制功能。依据《中华人民共和国反垄断法》第二十二条,具有市场支配地位的经营者不得利用数据、算法、技术以及平台规则等手段实施拒绝交易等滥用行为。在适用策略上,一是要坚持“精准规制”理念,既要防范头部平台滥用数据优势,又要避免过度干预削弱创新动能,体现反垄断法的谦抑性。二是对于明显缺乏正当理由、造成显著竞争损害的数据拒绝开放行为,可适度简化相关市场界定和支配地位认定的繁复程序,聚焦于行为本身的竞争效果分析。同时,可构建跨部门综合监管机制,避免出现规制真空。

总体而言,对于高质量数据集的开放共享应设置梯度,根据数据类型、稀缺性及使用场景,适配差异化的共享义务——对高成本、高稀缺的真机数据可适当放宽共享要求,对基础性、通用性数据则强化开放义务。通过这一“先谈后判”“刚柔并济”的阶梯式制度设计,实现数据流通与创新激励的精准平衡。

在梯度化治理框架之外,还需完善基础性的量化激励与分配机制。首先,建立具身智能数据价值评估体系,突破“贡献量化难”问题。由行业协会联合科研机构,明确真机数据、仿真数据、标注劳动的价值量化指标——真机数据重点考量采集成本、场景稀缺性、泛化价值;仿真数据重点考量质量、适配性;标注劳动重点考量精度、复杂度,形成可落地的价值评估模型,为收益分配提供依据。其次,建立“数据贡献—收益反哺”联动机制,数据信托机构根据数据价值评估结果,通过智能合约自动分配收益。同时,鼓励头部企业将数据授权收益的一定比例(如10%)反哺场景提供方,补偿其场景投入与风险承担。

【注:本文系2025年度国家社科基金重点项目“促进具身智能发展的法律适配研究”(项目编号:25AFX023)阶段性成果】

【注释】

①《中华人民共和国国民经济和社会发展第十五个五年规划纲要》,新华社,2026年3月13日。

②郑南宁、杨勐、姜维周等:《具身智能发展趋势与展望》,《中国工程科学》,2026年第2期。

③姜江:《科学谋划高质量数据集建设》,《国家治理》,2026年第7期。

④郝建业、汤宏垚、郑岩:《具身智能的关键挑战和技术》,《中国科学基金》,2026年第1期。

⑤郑磊、刘新萍主编,吕文增、张忻璐副主编:《中国公共数据开发利用报告(2025)》,北京:社会科学文献出版社,2025年。

责编/于洪清    美编/王梦雅

声明:本文为人民论坛杂志社原创内容,任何单位或个人转载请回复本微信号获得授权,转载时务必标明来源及作者,否则追究法律责任。

[责任编辑:银冰瑶]