大模型加速落地背后,一场新的竞争正在升级 高端数据标注,标出AI新高度
8月19日,宇树科技登陆科创板,成为“A股人形机器人第一股”。但这家备受追捧的公司在招股意向书中坦承:算力支撑薄弱、高质量数据缺乏导致模型智能化程度不足,已成为制约行业发展的重要瓶颈。
无独有偶。大模型头部企业DeepSeek创始人梁文锋近日在一场分享活动中提到,公司一半核心研究员在做数据标注,并将此视为现阶段最重要的工作。
在大多数人印象中,数据标注不过是“打标签”“画框框”的“体力活”。这两家站在AI前沿的企业,为何将它放在如此重要的地位?
数据标注,即将原始数据转化为AI可学习的高质量数据集,可理解为给AI提供“养料”。随着大模型加速落地,数据标注在AI世界的角色,已从配角升级为AI技术应用的核心支撑。整个产业正加速从劳动密集型向知识密集型转型。

杭州景联文科技的数据标注师们正在工作。 受访者供图
6月,国家数据局印发实施方案,推进行业高质量数据集建设行动,其中之一为标注攻坚行动,强调要引导数据标注从“以人为主”向“人机协同、专家深度参与”的多层次标注模式转变,推动数据标注向专业化、智能化跃升。
“搬运工”变身“炼金师”
浙江热热科技有限公司,新员工张睿最近在教AI做视频。她点开由某知名大模型生成的视频,从运镜、光影、色彩、物理规律等维度逐一打分。
“到这里工作后,我才知道这也属于数据标注,还是‘评测标注’这一新的热门分支。”张睿说。如今,大模型生成内容质量离精品还有差距,比如视频中人物表情僵硬、走台线路不对等,他们要标出来反馈给工程师,让大模型不断改进。
这一新岗位诞生背后,一场产业变革正在上演。
中国信通院等发布的《数据标注产业发展研究报告(2025年)》指出,数据标注产业正朝着高技术含量、高知识密度、高价值应用方向发展。据研究机构Grand View Research预测,2025—2030年,全球数据标注解决方案和服务市场将以20.3%的复合年均增长率增长,到2030年规模将达576.3亿美元(约4034.1亿元)。
“大模型的能力从0到60%,可能只要1TB数据,但从90%提升至91%,可能要1PB高质量数据。两者差距在千倍以上。”杭州景联文科技CEO刘云涛说,用户常吐槽大模型“一本正经地胡说八道”,原因之一即在于其缺乏高质量数据。这家数据采集标注头部企业甚至提出,AI算法开发80%的时间都在准备数据和标注。
高质量数据标注,决定着AI上限。
浙江大学软件学院教授张微解释,大模型早期训练所需数据确实很简单,告诉AI“这是树”“那是车”,或在“谢谢”后接“不客气”即可。这类初级标注如今大多可由AI完成,但市场对大模型应用的要求不断提高,AI急需高质量标注数据实现能力突破。
他用“三高”概括AI对数据集新的高要求:高专业性,如医疗影像数据需要资深医生参与标注,法律数据要求标注者具备法学与实务背景;高交互性,让AI识别人类语气的细微变化,精准判断指令背后的真实诉求;高复杂性,融合文本、图像、音频、视频等多模态数据,精度大幅提升,场景时序精准到秒级甚至毫秒级。
2024年,不少人欢呼大模型进入“场景落地元年”。但时至今日,具身智能、自动驾驶、智慧医疗等垂类大模型,多数仍在真实环境中受训——业内如今认为,通用具身模型的训练门槛,是千万小时级高质量真实物理交互数据。而截至今年初,全球此类数据仅50万小时。怎么办?
从宇树科技在招股意向书中披露的信息,可一探行业破题的方向:搭建大规模真实数据集,建立自动化标注机制,进而构建“数据飞轮”,以数据驱动业务持续增长。

8月19日,宇树科技机器人在2026世界机器人大会开幕式前表演。 新华社发
各地也在加速探索。如杭州已集聚具身智能、医疗、文旅、地球科学等4家国家人工智能应用中试基地。“各基地要建大量应用场景,场景落地会推动模型迭代,模型迭代离不开高质量数据集支撑,就会带来海量的数据采集和标注工作。”杭州市大数据管理服务中心相关负责人说。
在具身智能应用中试基地,记者看到,机器人咖啡师、机器人护士、四足巡检机器人正在现场搭建的咖啡馆、病房、山区线路等场景中“学本领”。
“学本领其实就是真实数据采集、标注、训练的过程。”工作人员以“拿杯子”为例介绍,过去训练多用模拟数据,机器人练得再好,一到复杂现实世界就会不知所措。真实环境训练可以建立4D感知甚至6D姿态追踪,让机器人认知真实世界如何运行,哪怕面对不同杯子等“意外情况”也能精准执行。这些数据经系统标注处理后,还能喂给其他机器人,让它们同步掌握。
数据标注,已从“搬运工”变成“炼金师”。
医生、律师、院士专家正在入场
目前,高端数据标注的路径公认有三条:“模型预标注+人工校准”“人工标注+模型检验”“模型预标注+模型检验”。
三者说白了是一回事:人机协同。专业一点讲,叫RLHF(基于人类反馈的强化学习)——这是以ChatGPT为代表的大模型能快速崛起的核心训练方法。背后逻辑很简单:人类像老师一样告诉AI对不对、怎么改。
如今,AI对“老师”的要求越来越高。全球数据标注领头羊Scale AI创始人直言,行业“需要最优秀和最聪明的头脑来贡献数据”。
专家标注市场快速崛起。在国内,医生、律师甚至院士及其团队正在入场。
“数据脱敏后,由我们进行专业标注,就像重新解读病历、影像或者检验报告,只不过对象不再是病人,而是大模型。”杭州某三甲医院的一名医生观察到,大模型协助医疗诊断、医药研发的案例越来越多,浙江医疗AI智能体“安诊儿”已累计服务超2亿人次,“参与数据标注,也是为了看看大模型的潜力到底在哪里。”
市场也急需既懂标注工具又懂行业知识的复合型人才。普通从业者正在加速专业化。
“以前会点鼠标就行,现在得懂物理、美术等专业知识。”在杭州高端数据标注基地,百川科技负责人蔡彬有个“甜蜜的烦恼”:最近一次性招了30多名本科毕业生,却仍追不上订单增长的速度。

杭州高端数据标注基地外景。 受访者供图
近日,国家信息中心牵头编制的《数据标注师岗位要求》团体标准正式发布。该标准把数据标注师分为基础、进阶、高阶三个等级,构建了一套覆盖数据标注师全生命周期管理体系,填补了行业空白。
“企业迫切需要权威统一的行业参照来开展人才培养,这也是行业健康发展的客观需要。”参与编制工作的张微介绍,蚂蚁科技、浙江省智能经济与智慧城市促进会、浙江大学等多家浙江单位参与了标准编制,侧面反映了我省对此类人才的旺盛需求与深度布局。
6月5日,杭州高端数据标注基地在上城区九堡街道正式开园。首期1.3万平方米的空间里,已陆续吸引火山引擎、海天瑞声等头部企业,以及百川智宸、九州文化等20多家上下游企业入驻。
此事成了行业“新风向”。此前,数据标注企业偏好中西部等劳动力成本较低的地区。“外地新员工工资三四千元,杭州要五六千元起步。”杭州铼铂锶科技有限公司相关负责人坦言,但杭州有高校、有技术、有市场,后发优势明显。
记者在园区遇到不少本科、研究生学历的新员工,他们来自影视、动画、中文、物理等专业。资深从业者中,还有人参与过科幻大片《流浪地球》的建模工作。
“高质量数据标注已成为系统性工程,对企业的技术和管理水平都提出了新挑战。”采访中,刘云涛反复提及:景联文的核心竞争力不是“标注平台”,而是“数据工程体系”。
他举例说,以前数据标注基地一般百来号人,数据准确度有95%就不错;现在一张订单可能就要上千人同时参与,准确率要求99%以上,怎么办?
景联文为此自研两个平台:SolarSense语料工程平台,覆盖从数据采集、治理、标注、质检到编目运营的全流程,实现规范化和高标准稳定输出;QApex数据生态平台,通过专家标注与评审机制,保障高专业度场景的数据质量。同时把技术人员派到一线,助力标注基地升级……一套“组合拳”下来,该公司的标注效率提升3倍以上。
当前,我国头部数据标注企业的业务构成中,完全人工标注约占10%—30%,人机协同模式占50%—70%,其余为模型自主标注。
“数据标注技术好像很一般,很多标注师还是在‘画框框’。”有准备接触数据标注的学生疑惑道。
“以前的‘框’是二维的,比如标什么是篮球;现在很多‘框’升级成四维了,比如标出比赛中篮球技战术的完整运用。”张微说,尽管没有大模型技术更新那般“炫酷”,但数据标注的技术也在升级,如跨模态时空融合技术,让摄像头、激光雷达、音频、传感器数据完成毫秒级同步;标注自进化闭环技术,让标注辅助模型越工作越聪明;以及面向未来的标注智能体技术,由AI当“项目经理”,解析规则、调度流水线,人类专家负责把关。
数据产业链“活”起来
3月,浙江公布首批19个高端数据标注基地试点。从公布的基地运营单位看,杭州市数据资源管理局、温州市数据集团有限公司、宁波博登智能科技有限公司……相关主体覆盖杭甬温等10个设区市,兼顾政府部门、国有数据平台与市场化科技企业,呈现专业化、市场化、辐射广等特点。
这一布局颇有深意。
2024年,国家数据局遴选成都、沈阳、合肥等7座城市承担数据标注基地建设任务,浙江、上海、广东等数字经济强省并未在列。但这并不意味着这些地区“按兵不动”。相反,各地一直在立足自身AI与产业优势,以高端标注等为抓手,探索数据要素化的更多实现路径。
“浙江高端数据标注产业一大特点,就是跟产业结合紧密。”浙江省智能经济与智慧城市促进会副秘书长张菊芳说。这也有助于产业形成商业闭环、实现良性发展。
在“中国模具之乡”黄岩,活跃着一群特殊“工匠”:不拿锉刀,却能让老师傅“三十年经验”“开口说话”;不碰模具,却能把千万件塑料的纹理、弧度、应力点一一“翻译”成AI能读懂的语言。他们就是数据标注师。
黄岩有数千家模塑企业,积累了海量的非标数据,将它们标注整理后喂给大模型后,模具设计就能从传统靠经验升级为靠数据和算法驱动。据悉,搭载AI的高端工业设计软件,可将模具设计周期从“以月计”压缩至“以小时计”,并推动当地传统模具向机器人关节等“智能功能模组”升级。
6月10日,北京火山引擎科技有限公司中标余杭的高端数据标注产业服务平台项目,投标报价4485万元。这一“大单”背后,是浙江高端数据标注产业另一种打开方式。
作为“浙江数字经济第一区”,余杭有以通义千问为代表的31个大模型通过备案登记,备案数占全省近三分之一。这里的高端标注任务,很多是人类偏好标注、思维链轨迹标注等“看不见摸不着”的内容。这也决定了余杭会走有别于黄岩等围绕单一产业垂直深耕的路子,更加注重平台生态建设。
“我们希望通过平台建设,同时赋能数据需求企业和标注服务企业,降低前者的进入门槛、拓展其发展空间,让后者降本增收。”余杭大数据经营有限公司副总经理周锦鸿介绍,余杭正在打造高端数据标注产业园,核心内容之一是打造高质量数据标注公共服务平台、高质量数据洞察分析平台等五大公共服务平台。园区计划三年引进优质数据标注及相关科技企业10家以上,累计营收突破6亿元,并带动约20亿元以上的数据产业发展。
在杭州高端数据标注基地,记者看到数据产业链“活”起来的生动一幕:一栋楼里,提供数据标注工具和平台的企业、数据标注服务企业,与利用这些工具生产AI漫剧的厂家比邻而居,共同串起数据“采集—标注—训练—应用”四大环节。
“产业链优势是一种系统性优势。底层的标注能力越强,上层应用的产出效率越高、市场需求会更大,对底层标注工具的需求也会越精准。这样,数据要素价值就能通过市场配置不断释放。”杭州市上城区数据资源管理局副局长娄莹说。
高端数据标注,也将标注数字经济的上限。
【链接】
数据标注赋能千行百业
数据标注在不同行业领域的应用场景广泛且深入,为人工智能产业的发展提供了坚实基础和强大动力。
科学领域,打造面向基础科学研究、科学计算、工程技术应用等典型应用场景的高质量数据集,推动科学各领域的进步和发展。
制造领域,打造面向智能制造、质量控制、供应链管理、故障诊断等典型应用场景的高质量数据集,助力企业实现更加高效、精确、灵活的生产模式,促进制造业的数字化转型升级。
农业领域,打造面向精准农业、智能养殖、气象预警与灾害应对、农业电子商务、智能农机应用等典型应用场景的高质量数据集,助力国家农业科学领域的技术发展与产业升级。
能源领域,打造面向智慧能源管理、智能电网、清洁能源与储能应用、能源交易典型应用场景的高质量数据集,更好地服务于能源系统的优化运行与社会可持续发展。
交通领域,打造面向城市交通智能调度与管理、公共交通优化、自动驾驶、智慧停车等典型应用场景的高质量数据集,实现对城市交通的全方位、精细化的管理和控制,提高城市交通的效率和安全性。
金融领域,打造面向风险防控、精准营销、智能投顾、反欺诈等典型应用场景的高质量数据集,全面提升金融服务效能与客户体验。
医疗领域,打造面向临床决策、医疗图像、药物研发、精准医疗、医疗教育教学等应用场景的高质量数据集,推动医学科研创新、医疗服务提升和健康管理智能化发展。
教育领域,打造面向智能教学、在线教育、互动课堂、个性化学习、智能辅导等典型应用场景的高质量数据集,为教育研究、教学改革、教育资源配置以及教育政策制定等提供科学依据和支持。
互联网治理领域,打造面向网络内容审查与管理、网络言论监管、网络安全防护、青少年保护、网络法治建设等典型应用场景的高质量数据集,实现更加科学、透明、高效的互联网治理,促进互联网产业健康发展。
公共安全领域,打造面向智慧安防、应急响应、灾害管理、智慧警务等典型应用场景的高质量数据集,提高公共安全管理效率和准确性。
(来源:中国信通院等发布的《数据标注产业发展研究报告(2025年)》记者 金春华 整理)

“转载请注明出处”
责任编辑:张丹萍
