
据数据供应商 Handshake 方估算,多家头部 AI 公司每年在“人类数据”上的支出已接近 10 亿美元量级。
从专家完成的 SFT、RLHF 数据,到可以运行数万次 rollout 的 RL 环境,再到 评分器(grader)、验证器(verifier)、训练 recipe、算力和整套 RL 服务,“数据公司”正在变成模型后训练的外部研发部门,长出了Surge AI、Mercor、Scale AI 这样的头部选手。
将视线转回中国数据市场,其体量也在快速增长。以字节为例,据报道,2026 年为世界模型训练数据安排的预算达到数千万元人民币, Coding 数据投入仅次于世界模型。
在这个背景下,一个值得关心的问题是,国产模型的后训练需要哪些数据,正在把哪些环节留在内部,哪些工作交给外部团队?如果模型公司需要专家任务、Agent 轨迹、Benchmark、可执行环境和自动验证信号,国内有哪些团队正在提供这些能力?
本期项目推荐,我们整理了一批新兴公司,包括智能知识、Copula Lab、原壤智能、UniPat AI、维纳智能等。这些公司都位于“后训练—评测—数据反馈”这条宽泛链条上,但商业形态不同:有的是专家数据供应商,有的是数据生产软件或 RL 环境创业公司,有的是研究型 Benchmark 团队,还有的把合成数据能力封装进企业 Agent。
一句话定位:智能知识是一家“专家网络 + 数据生产软件 + RL-ready 任务数据”的组合型供应商。
第一层是“一面千识”,负责专家供给。和简单开放任务、让普通标注员抢单的方式不同,它是根据模型公司的训练目标确定人才画像,再通过身份和学历验证、AI 面试等流程筛选专家,最后完成任务分配、质量追踪和报酬结算。
从目前公开的招募岗位看,一面千识以程序员为主,其它岗位覆盖金融证券、内容运营、法律实务、创新药研发、K12教育、记者编辑、医生、保险、税务和高校科研人员等。
以金融岗位为例,专家需要设计真实投研任务,准备公告、财报、行情和监管规则等材料,确定估值方法、核心假设和验收标准,再审核模型结论中的数据误读、风险遗漏与证据问题,偏向于“专业工作任务生产工作流”。
官方披露,一面千识已实现每日数百场AI面试、每月数千名专家成功接单,已连接50,000+领域专家。
第二层是 Xpert Studio,负责把专家组织成一条可规模化的数据生产线。平台覆盖标注界面配置、任务分发、权限管理、抽样审核、多轮质检、标注一致性计算和质量看板,也支持通过 API、SDK、云端或私有化方式接入模型团队现有的数据流程。
智能知识核心团队来自字节跳动 Seed 部门,已经获得头部大模型公司订单,完成初步 PMF,2026年6月宣布完成由锦秋基金、耀途资本联合投资的天使轮融资,此前种子轮获得五源资本和奇绩创坛投资。本轮资金主要用于扩张Coding、Enterprise Office、Agentic Tool Use等数据品类,以及升级专家画像、技能评估和人岗匹配系统。
一面千识对应Scale旗下的Outlier,负责招募、筛选和管理领域专家;Xpert Studio对应Scale Data Engine,由AI辅助,把任务配置、专家协作、标注审核和质量控制沉淀成软件;Terminal RL等数据资产,则开始向Scale AI 的RL Environments靠近,不仅包含题目和答案,还包含Docker环境、测试脚本、Oracle参考解法、运行轨迹和元数据;MCP任务则进一步加入受控网页、浏览器工具和程序化Verifier,可以让模型进入环境反复尝试,记录完整rollout,并通过测试结果获得明确的奖励信号。
值得注意的是,Xpert Studio还试图降低专业数据生产工具的门槛。平台目前提供三档定价:社区版面向独立开发者限量免费,会员价格为3000元/年,VIP为5万元/年,相比只服务头部实验室的大额数据合同,这套定价意味着小型Agent团队、研究机构和独立开发者也可以自己组织专家、设计评测集和迭代数据。
一句话定位:Copula Lab 提供专家工作流数据、Benchmark、评测和 RL 环境,主要面向前沿模型团队。
继编程之后,下一个前沿是模型能否真正深入高经济价值、高门槛的专业工作流。前沿后训练正在从静态问答、偏好标注和单轮任务,转向可交互、可验证、可扩展的专家工作流环境。
Copula Lab想解决的问题是:如何让模型在一个接近真实工作的环境中连续使用工具、处理多步依赖、修正错误,最终完成一份可以被专业人士验收的交付物。
目前官网公开的数据产品主要集中在 Coding、设计和专业办公任务。例如,WebDev 将自然语言需求、可运行的前端产品、开发轨迹、页面截图和专家审美评分组合成数据,可用于 SFT、偏好训练、RL 和评测。
如果说智能知识更像“专家众包网络+数据生产平台”,GOMAX 更偏向中文科学与产业数据及垂类评测,那么 Copula Lab 的特点,是从模型公司内部的后训练需求出发,反向设计数据和环境。
创始团队既做过 Agent 产品,也参与过模型后训练和 Benchmark 建设,因此它的出发点不是召集专家网络,而是模型在真实任务中为什么失败,从不同的 failure mode,形成不同的任务、轨迹、Rubric、环境和奖励信号,这使 Copula 的数据更接近模型训练团队实际采购的形态。
在本期几家公司中,Copula 是将 RL Environment 明确放在核心产品位置的一家。但目前公开案例主要证明它能够生产“任务+运行资产+轨迹+评分标准”,还不能证明这些环境已经具备大规模 RL 训练所要求的完整工程能力。
真正值得继续验证的是:环境能否被稳定重置和复现,能否直接连接模型公司的 Agent 与训练框架,能否支持大量并行 rollout;评分函数是否足够自动化、稳定且不容易被模型钻空子;以及这些任务经过训练后,能否在独立 Benchmark 上带来可复现的能力提升。
它不是传统意义上的数据公司,也暂时不像 Copula Lab 那样明确向模型公司销售专家工作流数据和 RL 环境。UniPat 更像一座数据与后训练实验室:先构造足够真实、足够困难的任务,找到模型的能力缺口;再围绕这些缺口生产数据、设计 Rubric,并通过实际后训练验证这些训练信号是否有效。
除了 Benchmark,UniPat 也在生产后训练数据并亲自训练模型。
UniPat 公开研究的主要贡献者包括 Liang Chen、Kuan Li 等人,公开资料未披露其融资情况,也没有明确说明 Benchmark、数据和 RL 环境的商业化收入。
UniPat 值得关注的地方,是它没有把 Benchmark、数据和后训练当成三件分离的事。
很多数据公司完成交付后,很难回答一个问题:这批数据到底有没有让模型变强?UniPat 的做法是先用真实任务找到模型的 failure mode,再围绕这些失败生产训练数据和评分标准,最后实际训练模型,并在留出集和外部 Benchmark 上验证能力有没有提升。
从 UniScientist、ExpertEval 到 BabyVision,其公开项目已经覆盖了三种不同的数据路线:LLM 大规模合成、专家直接生产,以及面向 RLVR 的可验证数据。它也分别用 Agentic SFT、Rubric rejection sampling 和 GRPO 做过后训练实验。相比单纯发布排行榜,这更接近一套“发现能力缺口—生产训练信号—训练模型—验证泛化”的数据研究闭环。
下一步需要观察的是,它会继续作为研究团队发布模型和 Benchmark,还是把这些能力封装成面向模型公司的环境、数据或后训练服务。
一句话定位:原壤智能目前通过两个品牌开展业务:负责专家招募和任务交付的 TalentsAI,以及负责高质量数据、Benchmark 和企业数据合作的 Humanlaya。
TalentsAI 是原壤智能的专家数据生产平台。它负责寻找不同学科的专业人员,验证学历、执业资格和工作经历,再将专家匹配给模型训练与评测项目。
据平台披露,TalentsAI 目前已有超过5万名专家入驻,覆盖300多个细分学科,其中包括5000多名博士级人才,并与10多家头部 AI Lab 合作。平台公开的任务类型包括复杂指令遵循、Rubric 设计与评测、HLE 高难度推理、RLHF、VLM、长文本与专业文档处理,以及金融、法律、医疗、自然科学、软件工程等领域的多轮对话和学科验证。
Humanlaya 则更像原壤智能的数据与评测实验室。它围绕真实专业工作推出 Benchmark 和高保真数据集,目前已经发布 BiomniBench、ExcelBench、$OneMillion-Bench 和 WorldTravel,覆盖生物医学分析、表格操作、专业知识工作和多模态旅行规划等任务。
原壤智能的公开招聘资料披露,公司已获得红杉中国与 BAI 资本的天使轮投资,融资近千万美元。
它同时踩在专家供给、数据生产和模型评测三个位置上。TalentsAI 解决“谁有资格定义专业工作”,Humanlaya 解决“如何把这种判断变成模型可理解、可比较的标准”。如果两边能够持续互相反馈,Benchmark 不只是一个对外传播产品,也会成为寻找训练数据需求和检验数据效果的入口。
接下来需要验证的,是5万名注册专家中有多少能够稳定参与高难度任务,公开 Benchmark 能否转化为持续的数据采购和评测收入,以及公司是否已经为模型客户生产了与公开测试集隔离、并能带来可量化训练提升的数据集。
一句话定位:维纳智能做的是大模型推理数据生成,以及基于这些数据构建闭环 Agent 系统。
但专家数据有一个天然限制:贵,而且慢。任务越专业,真正能够完成和审核的人就越少。所以还有公司选择了另一条路:让模型自己出题、自己生成推理过程和答案,再利用测试与反馈不断筛选和优化这些数据。
它提出的核心数据结构是 cQrA 四元组,即 Context、Question、reasoning 和 Answer。模型读取行业文档或结构化信息后,不只生成答案,还要主动提出问题,并生成相应的推理过程。
维纳把传统模型训练概括为“数据→Token”,自己的重点则是补上“Token→数据”:用模型输出重新生成专业推理数据,再让这些数据进入测试、优化和后续训练,形成“数据→Token→数据”的循环。
从目前公开的商业化产品看,维纳并不是把数据集单独摆上货架,而是将数据生成能力封装进企业 Agent。
创始人兼 CEO 柳崎峰毕业于中国科学院自动化研究所,曾任香港生成式人工智能研发中心总经理、平安集团加马 AI 研究院院长,并参与香港大模型训练和超算基础设施建设。
据公司官网披露,维纳智能总部位于香港,在深圳和北京设有分部,已完成由联想创投领投的千万美元级种子轮融资。
如果 AI 能够从企业文档、数据库和实际交互中持续生成高质量问题、推理过程和答案,企业就有可能建立自己的合成数据飞轮,不再完全依赖人工标注。
它更准确的定位是:合成推理数据公司,以及以数据反馈为底座的闭环 Agent 公司。
这条路径最大的难点,是如何验证 AI 生成的数据。模型自己出题、自己回答,也可能把原有错误和偏见循环放大。维纳能否建立独立的 verifier、专家抽检和真实业务结果反馈,将决定“AI 造数据”究竟是有效的训练信号,还是规模更大的合成噪声。
以上几个项目都在处理大模型后训练阶段的“数据”问题,但它们并不属于同一种公司。
Human Intelligence、原壤智能等接近专家供给与专业数据生产:它们试图找到真正理解任务的人,再把专家的知识转化为任务、答案、Rubric 和评价信号。Copula Lab 和 UniPat 更关注如何把真实工作变成 Benchmark、可执行任务或可验证环境,让模型不只回答问题,而是在接近实际的软件和工作流程中完成任务。维纳智能走的则是另一条相邻路线:利用模型生成问题、推理过程和答案,再通过企业应用中的反馈筛选和更新这些数据。
这些路径之间并非泾渭分明。一家公司既可能招募专家,也可能制作 Benchmark;既可能交付训练数据,也可能搭建环境、评分器和企业 Agent。
某种意义上,这也说明了国内后训练数据市场仍处在品类形成期。专家数据、Benchmark、RL 环境、自动验证和企业反馈尚未形成稳定、清晰的专业分工,模型公司更偏向将核心后训练环节留在内部,外部团队能够承接的主要是专家组织、任务生产和部分环境构造。
但无论从专家出发、从环境出发,还是让模型参与数据生成,这些项目的目标是一致的:构建更多来自真实工作、承载专业判断且能够被验证的高质量数据,让模型学会处理更复杂的任务,推动其向下一代智能演进。
我们也会继续关注这个赛道,动态记录其中的公司、产品以及后训练供应链的变化。
天涯的回归意味著文字复兴的可能,倘若天涯重启成功,那么就是意味著文字复兴取得成功,如若不然则反之。当然,未来并不是固定的,就像一个人的未来得由自己今后的每一次选择堆砌得来一样,天涯的未来也是由每一个天涯友人共同筑造起来的呀。so下半年又多一个文化圈看点-时代还否赞同世人用文字来表达个人观点?(加油【比心】)
齐鲁晚报·齐鲁壹点 怀晓男双组合林诗栋/温瑞博在亚运会上,又能交出怎样的成绩单?新华社发北京时间8月17日凌晨,WTT瑞典大满贯落下帷幕。王曼昱在女单决赛中4:2力克王艺迪,时隔多月终于打破本年度单打冠军荒。至此,国乒在本站赛事两冠一亚收官,冠军分别来自混双与女单项目。
特朗普:考虑到与金正恩的“良好关系”,已指示“大幅缩减”美韩联合军演规模
据央视新闻报道,美国总统特朗普16日说,已要求国防部大幅缩减美国与韩国的联合军演规模。特朗普在社交媒体发文说,这些军演“耗资巨大”,其中很大一部分由美国负担,同时对朝鲜释放出“完全不恰当和敌对的信号”。
油价最新消息:8月28日24时,预计油价每升将会重新上涨0.15元到0.17元
8月17日,星期一,新一轮油价计价周期开启,油价开局大涨!刚享受了两天“降价红利”,国内油价就又要抬头了。上周国内成品油刚刚完成年内第5次下调,全国92号汽油普遍回落0.18-0.20元/升,50升油箱的私家车加满一箱92号汽油少花约9元。
参加“香港青少年军事夏令营”的感悟。并为儿子在酷暑中坚持完成硬核训练。霍启刚透露,儿子自幼对军事抱有浓厚兴趣。
作为全球最大原油进口国和最大能源消费国,中国在本轮霍尔木兹海峡断航危机中展现出非一般的风险承受力,不仅未出现明显震荡,也是少数能将外部冲击转化为内部转型动力的国家之一。
来源:新闻坊 上门家政保洁本是便民服务却有人借机觊觎雇主财物、伺机行窃近日,浦东警方就快速破获一起家政盗窃案7月27日中午浦东公安分局康桥派出所接到辖区居民顾女士报警求助称家中两条贵重项链在当天上午不翼而飞损失总价值高达3万余元!
看菲律宾这两年在南海的操作,一直有个感受:它像是在牌桌上不停往里扔筹码。明知道两边体量差着一大截,却还是一次次往前凑。很多人骂它不自量力,倒觉得没这么简单。马尼拉心里有本账,它赌的从来就不是自己的力气,而是身后那位大块头到底肯不肯下场。