Cointime

扫码下载App
iOS & Android

谷歌这一「大招」,要逼死多少 AI 标注公司?

项目方

撰文:举大名耳

如果说,当下的生成式 AI,是一个正在茁壮成长的孩子,那么源源不断的数据,就是其喂养其生长的食物。

而数据标注,就是制作这一「食物」的过程。

然而,这一过程真的很卷,很累人。

进行标注的「标注师」不仅需要反复地识别出图像中的各种物体、颜色、形状等,有时候甚至需要对数据进行清洗和预处理。

随着 AI 技术的不断进步,人工数据标注的局限性也日益显现。人工数据标注不仅耗时耗力,而且质量有时难以保障。

为了解决这些问题,谷歌最近提出了一种用大模型替代人类进行偏好标注的方法,称为 AI 反馈强化学习(RLAIF)。

研究结果表明,RLAIF 可以在不依赖人类标注的情况下,产生与人类反馈强化学习(RLHF)相当的改进效果,两者的胜率都是 50%。同时,RLAIF 和 RLHF 都优于监督微调(SFT)的基线策略。

这些结果表明,RLAIF 不需要依赖于人工标注,是 RLHF 的可行替代方案。

那么,倘若这一技术将来真的推广、普及,众多还在靠人工「拉框」的数据标注企业,从此是否就真的要被逼上绝路了?

数据标注现状

如果要简单地总结目前国内标注行业的现状,那就是:劳动量大,但效率却不太高,属于费力不讨好的状态。

标注企业被称为 AI 领域的数据工厂,通常集中在东南亚、非洲或是中国的河南、山西、山东等人力资源丰富的地区。

为了控制成本,标注公司的老板们会在县城里租一块场地,摆上电脑,有订单了就在附近招人兼职来做,没单子就解散休息。

简单来说,这个工种有点类似马路边上的临时装修工。

在工位上,系统会随机给「标注师」一组数据,一般包含几个问题和几个回答。

之后,「标注师」需要先标注出这个问题属于什么类型,随后给这些回答分别打分并排序。

此前,人们在谈论国产大模型与 GPT-4 等先进大模型的差距时,总结出了国内数据质量不高的原因。

但数据质量为何不高?一部分原因,就出在数据标注的「流水线」上。

目前,中文大模型的数据来源是两类,一类是开源的数据集;一类是通过爬虫爬来的中文互联网数据。

中文大模型表现不够好的主要原因之一就是互联网数据质量,比如,专业人士在查找资料的时候一般不会用百度。

因此,在面对一些较为专业、垂直的数据问题,例如医疗、金融等,就要与专业团队合作。

可这时,问题又来了:对于专业团队来说,在数据方面不仅回报周期长,而且先行者很有可能会吃亏。

例如,某家标注团队花了很多钱和时间,做了很多数据,别人可能花很少的钱就可以直接打包买走。

面对这样的「搭便车困境」,国内大模型纷纷陷入了数据虽多,但质量却不高的诡异困境。

既然如此,那目前国外一些较为领先的 AI 企业,如 OpenAI,他们是怎么解决这一问题的?

其实,在数据标注方面,OpenAI 也没有放弃使用廉价的密集劳动来降低成本。

例如,此前就曝出其曾以 2 美元 / 小时的价格,雇佣了大量肯尼亚劳工进行有毒信息的标注工作。

但关键的区别,就在于如何解决数据质量和标注效率的问题。

具体来说,OpenAI 在这方面,与国内企业最大的不同,就在于如何降低人工标注的「主观性」、「不稳定性」的影响。

OpenAI 的方式

为了降低这样人类标注员的「主观性」和「不稳定性」,OpenAI 大致采用了两个主要的策略:

1、人工反馈与强化学习相结合

这里先说说第一点,在标注方式上,OpenAI 的人工反馈,与国内最大的区别,就在于其主要是对智能系统的行为进行排序或评分,而不是对其输出进行修改或标注。

智能系统的行为,是指智能系统在一个复杂的环境中,根据自己的目标和策略,做出一系列的动作或决策。

例如玩一个游戏、控制一个机器人、与一个人对话等。

智能系统的输出,则是指在一个简单的任务中,根据输入的数据,生成一个结果或回答,例如写一篇文章、画一幅画。

通常来说,智能系统的行为比输出更难以用「正确」或「错误」来判断,更需要用偏好或满意度来评价。

而这种以「偏好」或「满意度」为标准的评价体系,由于不需要修改或标注具体的内容,从而减少了人类主观性、知识水平等因素对数据标注质量以及准确性的影响。

诚然,国内企业在进行标注时,也会使用类似「排序」、「打分」的体系,但由于缺乏 OpenAI 那样的「奖励模型」作为奖励函数来优化智能系统的策略,这样的「排序」和「打分」,本质上仍然是一种对输出进行修改或标注的方法。

2、多样化、大规模的数据来源渠道

国内的数据标注来源主要是第三方标注公司或科技公司自建团队,这些团队多为本科生组成,缺乏足够的专业性和经验,难以提供高质量和高效率的反馈。

而相较之下,OpenAI 的人工反馈则来自多个渠道和团队。

OpenAI 不仅使用开源数据集和互联网爬虫来获取数据,还与多家数据公司和机构合作,例如 Scale AI、Appen、Lionbridge AI 等,来获取更多样化和高质量的数据。

与国内的同行相比,这些数据公司和机构标注的手段要「自动」和「智能」得多。

例如,Scale AI 使用了一种称为 Snorkel 的技术,它是一种基于弱监督学习的数据标注方法,可以从多个不精确的数据源中生成高质量的标签。

同时,Snorkel 还可以利用规则、模型、知识库等多种信号来为数据添加标签,而不需要人工直接标注每个数据点。这样可以大大减少人工标注的成本和时间。

在数据标注的成本、周期缩短的情况下,这些具备了竞争优势的数据公司,再通过选择高价值、高难度、高门槛的细分领域,如自动驾驶、大语言模型、合成数据等,就可不断提升自己的核心竞争力和差异化优势。

如此一来,「先行者会吃亏」的搭便车困境,也被强大的技术和行业壁垒给消弭了。

标准化 VS 小作坊

由此可见,AI 自动标注技术,真正淘汰的只是那些还在使用纯人工的标注公司。

尽管数据标注听上去是一个「劳动密集型」产业,但是一旦深入细节,便会发现,追求高质量的数据并不是一件容易的事。

以海外数据标注的独角兽 Scale AI 为代表,Scale AI 不仅仅在使用非洲等地的廉价人力资源,同样还招聘了数十名博士,来应对各行业的专业数据。

数据标注质量,是 Scale AI 为 OpenAI 等大模型企业提供的最大价值。

而要想最大程度地保障数据质量,除了前面提到的使用 AI 辅助标注外,Scale AI 的另一大创新,就是了一个统一的数据平台。

这些平台,包括了 Scale Audit、Scale Analytics、ScaleData Quality 等。通过这些平台,客户可以监控和分析标注过程中的各种指标,并对标注数据进行校验和优化,评估标注的准确性、一致性和完整性。

可以说,这样标准化、统一化的工具与流程,成为了区分标注企业中「流水线工厂」和「手工小作坊」的关键因素。

在这方面,目前国内大部分的标注企业,都仍在使用「人工审核」的方式来审核数据标注的质量,只有百度等少数巨头引入了较为先进的管理和评估工具,如 EasyData 智能数据服务平台。

如果在关键的数据审核方面,没有专门的工具来监控和分析标注结果和指标,那对数据质量的把关,就仍旧只能沦为靠「老师傅」眼力见的作坊式水准。

因此,越来越多的国内企业,如百度、龙猫数据等,都开始利用机器学习和人工智能技术,提高数据标注的效率和质量,实现人机协作的模式。

由此可见,AI 标注的出现,并不是国内标注企业的末日,而只是一种低效、廉价、缺乏技术含量的劳动密集型标注方式的末日。

评论

所有评论

推荐阅读

  • 立讯精密:公司及立讯技术涉337调查,尚处立案初期

    10月10日,立讯精密公告,公司及控股子公司东莞立讯技术股份有限公司被列为美国国际贸易委员会337调查被调查方,涉及美国专利US 10,90.37万。ITC于当地时间2026年10月9日正式启动调查,调查编号337-TA-1526,目前尚处于立案初期,尚未就相关侵权主张作出实质认定;涉案产品处于客户验证阶段,尚未进入量产状态。

  • 法国财委会通过稳定币兑换税与加密离境税修正案

    10月10日,据Decrypt报道,法国国民议会财政委员会本周通过两项加密税收修正案:自2027年1月1日起,将兑换受MiCA监管的稳定币视为应税出售;并拟对过去10年内至少6年为法国税务居民、加密资产合计价值超80万欧元而迁居海外的纳税人征收离境税。委员会10月9日以31票对3票否决预算收入部分,全体国民议会将基于政府原始文本审议,修正案不会自动纳入,支持者需在10月13日开始的辩论中重新提出,正式投票定于10月20日,相关措施尚未成为法律。稳定币修正案由左翼GDR党团成员Nicolas Sansu及16名联署者提出,未设新税率,拟将收益纳入法国现行31.4%统一税制。委员会还通过修正案,允许将加密资产亏损结转10年抵扣未来收益。

  • Entropy花费569.98枚HYPE拍下xiaomi(小米)代码,或即将上线其永续合约

    10月10日,HIP-3市场部署者Entropy花费569.98枚HYPE拍下代码xiaomi,Entropy或即将上线其永续合约。

  • 韩国金融委:交易所大股东持股限制不针对特定企业

    10月10日,据韩国金融委员会主席李亿元表示,正在推进的《数字资产基本法》中关于虚拟资产交易所大股东持股限制的规定,并非针对特定人士或企业,而是考虑到交易所制度化运营后需承担更高公共责任。目前韩国虚拟资产交易所采取每3年更新申报制度,未来《数字资产基本法》实施后将转为许可制运营。李亿元称,交易所具有基础设施属性,需具备与其地位相匹配的公共性和责任性。

  • 伯恩斯坦拆解AI基建成本:每吉瓦投资最高395亿美元

    10月10日,伯恩斯坦研报显示,采用不同AI加速器架构,建设1GW数据中心所需的资本开支约为346亿至395亿美元。其中,英伟达Vera Rubin架构的建设成本最高,OpenAI自研ASIC架构Jalapeno则相对较低。伯恩斯坦将英伟达Rubin NVL72单机柜成本预期从此前的910万美元大幅下调至752万美元,降幅约17%,主要反映了对HBM价格和NAND存储容量预期的调整。研报还指出,AI数据中心的主要经济负担并非电费,而是巨额资本开支及其产生的折旧。

  • 长鑫技术新突破:4F²架构产品预计年底亮相

    10月10日,长鑫存储4F² DRAM架构研发近期取得关键进展。该公司总裁曹堪宇博士在第四届集成芯片和芯粒大会上发表演讲,全面介绍了长鑫存储在DRAM器件、4F²架构及混合键合等方向的技术探索与积累,并官宣预计年底将推出融合了上述先进技术的新一代DDR5 RDIMM产品。

  • 中国证监会召开资本市场和金融形势专家座谈会

    10月10日,中国证监会党委书记、主席吴清在北京召开座谈会,与部分上市公司负责人、证券基金机构专家深入交流,就当前资本市场和金融形势充分听取意见建议。座谈会上,大家一致认为,我国宏观经济稳中向好,产业结构转型持续深化,资本市场运行总体稳健,多层次市场功能有效发挥,虽然面临一些风险挑战,但高质量发展的态势不会改变,对经济运行和资本市场充满信心。同时,与会专家对更好推动资本市场平稳健康发展提出了具体建议,主要包括:持续加强稳市机制建设,进一步拓宽中长期资金来源、渠道和入市方式,发展壮大耐心资本;推动有条件的上市公司加大分红回购力度,完善投资者回报和权益保护机制;优化发行上市制度,支持不同类型、不同行业、多元化的优质企业发展壮大;强化交易监管,加强跨境风险监测应对;研究储备更多增量政策工具;等等。吴清表示,上市公司和行业机构是市场的重要主体,希望大家积极建言献策,共同把资本市场建设好,更好回报广大投资者,为中国式现代化建设积极贡献力量。中国证监会有关司局负责同志参加座谈。

  • Hyperliquid巨鲸在10·10崩盘周年持有3236万美元比特币空单

    10月10日,据Bitcoin.com报道,一Hyperliquid巨鲸在「10·10崩盘」一周年之际持有391.48枚BTC空单,规模3236万美元,平均入场价82863.10美元,采用13倍全仓杠杆,账户权益719万美元,清算价99801.20美元,较当前价格高约20%。数据显示,该地址已累计交易4726笔,近一周永续合约盈利95.2万美元,最大回撤11.03%;截至发稿该空单浮盈约7.55万美元。2025年10月10日,加密市场经历史上最大清算事件,清除了超191亿美元的杠杆头寸。比特币��报约82754美元,较126080美元历史高点低约34%。Coinglass数据显示,若BTC回升至85000美元,约33亿美元空单将面临风险。Hyperliquid的BTC未平仓合约约38040枚,该巨鲸约占1%。

  • 摩根士丹利增持比特币,总持仓量达1.06万枚

    10月10日,摩根士丹利通过旗下现货比特币交易所交易基金MSBT增持91.69枚比特币,总持仓量升至10639枚,当前价值约8.8亿美元。

  • Strive募资约5500万美元 足够买入约638枚比特币

    10月10日,据Bitcoin.com报道,Strive的SATA优先股本周募资约5500万美元,足以购买约638枚比特币。据追踪平台Bitcointreasuries.net统计,该数字来自周度仪表盘快照,仅计入以100美元面值或以上成交的成交量,再按经SEC文件校准的捕获比率估算其通过ATM计划售出的新股数量。SATA在10月5日及6日多数时间高于面值成交,但周三至周五全部低于面值,发行随之暂停——这是此类机制的内置刹车:低于面值发行新股会侵蚀计划承诺,须待买方推高价格方能恢复。同期Michael Saylor旗下Strategy在9月28日至10月4日未售出任何STRC股份,其10月1日至4日购入的334枚BTC由出售MSTR普通股提供资金,持仓升至848000枚BTC。Strive截至10月2日持有29462枚BTC。两家公司周一的8-K文件预计将确认实际购币数量。