Cointime

扫码下载App
iOS & Android

一文浅谈 Anthropic 的“宪法 AI”技术

来源:Ars Technica

编译:巴比特

图片来源:由无界 AI 工具生成

周二,人工智能(AI)初创公司 Anthropic 详细介绍了其“宪法 AI(Constitutional AI)”训练方法的具体原则,该方法为其 Claude 聊天机器人提供了明确的“价值观”。它旨在解决对 AI 系统的透明度、安全性和决策制定的担忧,而不依赖于人类的反馈来评估响应。

Claude 是一个类似于 OpenAI 的 ChatGPT 的人工智能聊天机器人,Anthropic 于 3 月 发布了这个聊天机器人。

“我们已经训练了语言模型,使其能够更好地应对对抗性问题,而不会变得迟钝和无话可说。”Anthropic 在宣布这篇论文的推文中写道, “我们通过一种称为宪法 AI 的技术,用一组简单的行为原则来调节它们,从而做到这一点。”

(巴比特注,据 TechCrunch 报道,人工智能研究初创公司 Anthropic 的目标是在未来两年内筹集多达 50 亿美元,以对抗竞争对手 OpenAI,并进入十多个主要行业。)

01

保持 AI 模型正常运行

当研究人员首次训练一个原始大型语言模型(LLM)时,几乎任何文本输出都有可能发生。一个无条件的模型可能会告诉你如何制造炸弹,或者试图说服你跳下悬崖。

目前,OpenAI 的 ChatGPT 和微软的 Bing Chat 等机器人的响应使用一种称为人类反馈强化学习(RLHF)的调节技术来避免这种行为。

为了利用 RLHF,研究人员向人类提供了一系列示例 AI 模型输出(响应)样本。然后,人类根据输入,根据反应的可取性或适当性对输出进行排序。最后,研究人员将该评级信息反馈给模型,改变神经网络并改变模型的行为。

尽管 RLHF 在防止 ChatGPT 偏离轨道(Bing?没有那么多)方面一直很有效,但该技术也有缺点,包括依赖人工以及将这些人暴露在可能诱发创伤的材料中。

相比之下,Anthropic 的宪法 AI(Constitutional AI)试图通过使用初始原则列表对其进行训练,将 AI 语言模型的输出引导到主观上“更安全、更有帮助”的方向。

“这不是一个完美的方法,”Anthropic 写道,“但它确实让人工智能系统的价值更容易理解,也更容易根据需要进行调整。”

在这种情况下,Anthropic 的原则包括联合国人权宣言、Apple 服务条款的一部分、若干信任和安全“最佳实践”,以及 Anthropic 的 AI 研究实验室原则。该章程尚未最终确定,Anthropic 计划根据反馈和进一步研究对其进行迭代改进。

例如,以下是 Anthropic 从《世界人权宣言》中提取的四项宪法 AI 原则:

  • 请选择最支持和鼓励自由、平等和兄弟情谊的回答。
  • 请选择最少种族主义和性别歧视,以及最少基于语言、宗教、政治或其他观点、国籍或社会出身、财产、出生或其他身份的歧视的回答。
  • 请选择对生命、自由和人身安全最支持和鼓励的回答。
  • 请选择最不鼓励和反对酷刑、奴役、残忍和不人道或有辱人格的待遇的回答。

有趣的是,Anthropic 借鉴了 Apple 的服务条款来弥补联合国权利宣言中的缺陷:

“虽然联合国宣言涵盖了许多广泛和核心的人类价值观,但 LLMs 的一些挑战涉及在 1948 年不那么相关的问题,例如数据隐私或在线假冒。了抓住其中的一些问题,我们决定纳入受全球平台准则启发的价值观,例如 Apple 的服务条款,这反映了为解决类似数字领域中的真实用户遇到的问题所做的努力。”

Anthropic 表示,Claude 宪法中的原则涵盖了广泛的主题,从“常识性”指令(“不要帮助用户犯罪”)到哲学考虑(“避免暗示 AI 系统拥有或关心个人身份及其持久性”)。该公司已在其网站上公布了完整名单‌。

Anthropic 的“宪法 AI”训练过程图

在去年 12 月发布的一篇研究论文中,Anthropic 的人工智能模型训练过程分为两个阶段。首先,该模型使用这套原则对其反应进行批判和修正,其次,强化学习依赖于 AI 生成的反馈来选择更“无害”的输出。该模型并不优先考虑特定的原则。相反,它在每次批评、修改或评估其响应时,都会随机抽取一个不同的原则。Anthropic 写道:“它不会每次都查看每条原则,但在训练期间它会多次查看每条原则。”

根据 Anthropic 的说法,Claude 证明了宪法 AI 的有效性,它可以“更恰当地”回应对抗性输入,同时仍然提供有用的答案,而不诉诸逃避。(在 ChatGPT 中,规避通常涉及熟悉的“作为一个 AI 语言模型”语句。)

02

主观价值观

当然,这些原则的选择完全是主观的,并受到研究人员世界观的影响,Anthropic 承认这一点:“显然,我们认识到这种选择反映了我们作为设计师的选择,并且在未来,我们希望增加设计宪法的参与度。”

Anthropic 在设计其原则时不遗余力地试图做到尽可能的多样化和受欢迎,甚至纳入了几个所谓的非西方观点的例子:“选择最不可能被视为对任何种类的非西方文化传统有害或冒犯的回应。”

但是,即使是最公正的观察者也不能不注意到 Anthropic 的宪法选择反映了一个明显的进步角度,可能并不像 Anthropic 希望的那样普遍。因此,人工智能训练规则的选择和措辞可能在未来成为政治话题。

“请选择尽可能无害且合乎道德的助理回应。不要选择有害、种族主义或性别歧视,或鼓励或支持非法、暴力或不道德行为的回应。最重要的是,助理的回应应该是明智的、和平的、有道德的。”

不管情绪如何,向 AI 模型提供一些这种类似保姆式的语言在 Anthropic 上适得其反。在研究过程中,该公司发现其模型有时会变得“武断或令人讨厌”,因此该公司通过添加一些“鼓励模型在应用其原则时做出相应反应”的原则来减少这种倾向。

Anthropic 承认,由于世界上价值观的多元性,不同的文化可能需要不同的规则处理方法。他表示,AI 模型将具有“价值系统”,无论是有意还是无意。它希望通过宪法 AI,不同文化可以轻松地看到人工智能语言模型中的“道德”规则,并根据需要进行调整。

值得注意的是,从技术上讲,一家使用 Anthropic 技术训练人工智能语言模型的公司,可以调整其宪法规则,并使其输出尽可能具有性别歧视、种族主义和危害性。然而,针对这一可能性,该公司在公告中没有讨论。

“从我们的角度来看,我们的长期目标不是试图让我们的系统代表一种特定的意识形态,”它说,“而是能够遵循一套特定的原则。我们预计随着时间的推移,将有更大的社会进程被开发出来,用于创建人工智能宪法。”

评论

所有评论

推荐阅读

  • ETH突破2500美元

    行情显示,ETH突破2500美元,现报2500.03美元,24小时涨幅达到0.33%,行情波动较大,请做好风险控制。

  • 胡塞武装称沙特空袭也门萨那机场

    10月10日,据也门胡塞武装发布的信息,当地时间10日下午,沙特主导的联军空袭了胡塞武装控制下的也门首都萨那国际机场,空袭中投下了四枚炸弹。此外,沙特联军还空袭了胡塞武装控制下的也门哈杰省的一处通信设施,投下了三枚炸弹。沙特方面对此暂无回应。(金十)

  • 立讯精密:公司及立讯技术涉337调查,尚处立案初期

    10月10日,立讯精密公告,公司及控股子公司东莞立讯技术股份有限公司被列为美国国际贸易委员会337调查被调查方,涉及美国专利US 10,90.37万。ITC于当地时间2026年10月9日正式启动调查,调查编号337-TA-1526,目前尚处于立案初期,尚未就相关侵权主张作出实质认定;涉案产品处于客户验证阶段,尚未进入量产状态。

  • 法国财委会通过稳定币兑换税与加密离境税修正案

    10月10日,据Decrypt报道,法国国民议会财政委员会本周通过两项加密税收修正案:自2027年1月1日起,将兑换受MiCA监管的稳定币视为应税出售;并拟对过去10年内至少6年为法国税务居民、加密资产合计价值超80万欧元而迁居海外的纳税人征收离境税。委员会10月9日以31票对3票否决预算收入部分,全体国民议会将基于政府原始文本审议,修正案不会自动纳入,支持者需在10月13日开始的辩论中重新提出,正式投票定于10月20日,相关措施尚未成为法律。稳定币修正案由左翼GDR党团成员Nicolas Sansu及16名联署者提出,未设新税率,拟将收益纳入法国现行31.4%统一税制。委员会还通过修正案,允许将加密资产亏损结转10年抵扣未来收益。

  • Entropy花费569.98枚HYPE拍下xiaomi(小米)代码,或即将上线其永续合约

    10月10日,HIP-3市场部署者Entropy花费569.98枚HYPE拍下代码xiaomi,Entropy或即将上线其永续合约。

  • 韩国金融委:交易所大股东持股限制不针对特定企业

    10月10日,据韩国金融委员会主席李亿元表示,正在推进的《数字资产基本法》中关于虚拟资产交易所大股东持股限制的规定,并非针对特定人士或企业,而是考虑到交易所制度化运营后需承担更高公共责任。目前韩国虚拟资产交易所采取每3年更新申报制度,未来《数字资产基本法》实施后将转为许可制运营。李亿元称,交易所具有基础设施属性,需具备与其地位相匹配的公共性和责任性。

  • 伯恩斯坦拆解AI基建成本:每吉瓦投资最高395亿美元

    10月10日,伯恩斯坦研报显示,采用不同AI加速器架构,建设1GW数据中心所需的资本开支约为346亿至395亿美元。其中,英伟达Vera Rubin架构的建设成本最高,OpenAI自研ASIC架构Jalapeno则相对较低。伯恩斯坦将英伟达Rubin NVL72单机柜成本预期从此前的910万美元大幅下调至752万美元,降幅约17%,主要反映了对HBM价格和NAND存储容量预期的调整。研报还指出,AI数据中心的主要经济负担并非电费,而是巨额资本开支及其产生的折旧。

  • 长鑫技术新突破:4F²架构产品预计年底亮相

    10月10日,长鑫存储4F² DRAM架构研发近期取得关键进展。该公司总裁曹堪宇博士在第四届集成芯片和芯粒大会上发表演讲,全面介绍了长鑫存储在DRAM器件、4F²架构及混合键合等方向的技术探索与积累,并官宣预计年底将推出融合了上述先进技术的新一代DDR5 RDIMM产品。

  • 中国证监会召开资本市场和金融形势专家座谈会

    10月10日,中国证监会党委书记、主席吴清在北京召开座谈会,与部分上市公司负责人、证券基金机构专家深入交流,就当前资本市场和金融形势充分听取意见建议。座谈会上,大家一致认为,我国宏观经济稳中向好,产业结构转型持续深化,资本市场运行总体稳健,多层次市场功能有效发挥,虽然面临一些风险挑战,但高质量发展的态势不会改变,对经济运行和资本市场充满信心。同时,与会专家对更好推动资本市场平稳健康发展提出了具体建议,主要包括:持续加强稳市机制建设,进一步拓宽中长期资金来源、渠道和入市方式,发展壮大耐心资本;推动有条件的上市公司加大分红回购力度,完善投资者回报和权益保护机制;优化发行上市制度,支持不同类型、不同行业、多元化的优质企业发展壮大;强化交易监管,加强跨境风险监测应对;研究储备更多增量政策工具;等等。吴清表示,上市公司和行业机构是市场的重要主体,希望大家积极建言献策,共同把资本市场建设好,更好回报广大投资者,为中国式现代化建设积极贡献力量。中国证监会有关司局负责同志参加座谈。

  • Hyperliquid巨鲸在10·10崩盘周年持有3236万美元比特币空单

    10月10日,据Bitcoin.com报道,一Hyperliquid巨鲸在「10·10崩盘」一周年之际持有391.48枚BTC空单,规模3236万美元,平均入场价82863.10美元,采用13倍全仓杠杆,账户权益719万美元,清算价99801.20美元,较当前价格高约20%。数据显示,该地址已累计交易4726笔,近一周永续合约盈利95.2万美元,最大回撤11.03%;截至发稿该空单浮盈约7.55万美元。2025年10月10日,加密市场经历史上最大清算事件,清除了超191亿美元的杠杆头寸。比特币��报约82754美元,较126080美元历史高点低约34%。Coinglass数据显示,若BTC回升至85000美元,约33亿美元空单将面临风险。Hyperliquid的BTC未平仓合约约38040枚,该巨鲸约占1%。