Cointime

扫码下载App
iOS & Android

给波士顿动力机器狗装上ChatGPT后,会发生什么?

项目方

波士顿动力的「大黄狗」Spot 可以说是网红机器人的典范。

会巡逻、会搬砖、会跳舞 Spot 自诞生以来就吸引了全世界机器人爱好者的目光,谁能拒绝像这样一条动作灵活、姿态憨厚,还会卖萌的机器狗呢。

经过多年的发展,卖萌已经不再是 Spot 的「主业」,根据波士顿动力的介绍,Spot 现在能帮助人类完成一些特定场景下的工作,例如在跨洋轮船上检测仪表、参与地势复杂的勘测或救援工作等等。

如果给 Spot 这么灵活的身躯,装上一个像 ChatGPT 这么聪明的大脑,会发生什么?

人工智能专家 Santiago Valdarrama 还真做出来了这么一条拥有「最强大脑」的 Spot。

用 ChatGPT 大幅简化人机交互

Santiago 在 Twitter 上分享了他与改造版 Spot 互动的视频,这可能是史上第一条会讲话、会聊天的机器狗。

在演示视频中可以看到,Spot 并不仅仅是装了个「Siri」那么简单,当它在回答人类问题时,它的身体也会随着语句的内容和语调一起摆动,看上去就像是科幻片中的 Wall-E 走进了现实。

当你问到一些「Yes Or No」的简单问题时,它还会用「点头」「摇头」等身体语言代替语音来回答你,由此可见 Spot 远不是内置了一个智能音箱那么简单。

接入 ChatGPT 后,Spot 最大的变化就是听得懂人话,并且能够和使用者用自然语言交流。

Santiago 演示了一个场景,他跟 Spot 说因为它太碍事导致房间太拥挤了,让它往后稍稍,话音刚落 Spot 就理解了 Santiago 的意思,往后退了几步。

怎么样,是不是已经有科幻电影中呼唤机器人工作那味了。

过去操作 Spot 需要用类似无人机的大型遥控器或者用电脑输入复杂的指令,而现在 ChatGPT 的加入赋予了 Spot 强大的自然语言理解能力,动动嘴就能与机器人交互。

在这个过程中,ChatGPT 担任了人类与机器人之间的翻译,把人类输入的「人话」变成机器能看懂的指令,再把机器人的反馈用实际行为或者「人话」表达出来。

Santiago 介绍,他们把 Spot 的文件输进了 ChatGPT,并向其解释了文件的结构以及如何读取这个文件,从而实现了与 Spot 语音对话和操作。

操作员与 Spot 之间的交互被大幅简化,人们可以直接问它:「你的电量还有多少?」,然后 Spot 就会用语音的方式回答,这其中用到了 Google 文字转语音的技术,再把 ChatGPT 的答复经 Spot 的「口」讲出来。

Spot(或者说内置的 ChatGPT)会根据实际情况来回答问题,例如当你问它接下来要完成什么任务时,它会根据设定好的任务列表来作答,这在很大程度上避免了 ChatGPT 编造事实的情况。

当操作者给 Spot 下达像转向 90 度、前进 1 米这样的命令时,Spot 会联动内部的传感器和定位系统,精准地响应这些命令,不会说因为「大脑过于发达」而失去控制。

有趣的是,当你问它「你是谁?」的问题时,它会回答「我是 OpenAI。」,而不是机器狗 Spot。

Santiago 所在的公司 Levatas 是一家与波士顿动力合作的 AI 公司,为企业提供专业解决方案,帮助企业探索如何利用机器人解决实际问题。

Santiago 认为,给 Spot 装上 ChatGPT 最大的实际意义,是把原本只有技术人员才能处理的复杂数据变成了任何人都能看得懂、听得懂的自然语言。

机器人每次在执行任务前,都要输入冗长的指令集;在结束工作后,还会产生大量的数据,只有最专业的技术人员才能从这些数据中分析出问题。

但现在通过 ChatGPT,简单的两句话就能搞定。

当机器人的操作门槛变低之后,机器人的使用场景就会随之变得丰富起来。

AI 大模型的潜力不容小觑

「最强大脑」版 Spot 并不是一蹴而就的,在一个月前,Santiago 曾发布一个视频介绍了一条能「听懂人话」的 Spot,其用到的是 OpenAI 另一个重要 AI 模型 Whisper。

在这个「初版」智能 Spot 中,Santiago 更详细地介绍了其中的原理:

Whisper 可以高效地把语音实时转换成文字,转换的正确率和速度都非常可观。通过把 Whisper 与 Spot 的 SDK 结合在一起,它可以从人类说的话中提取关键文字,然后通过 SDK 向 Spot 发送命令。

只需要向它说句话,就可以让 Spot 离开充电坞,起身去检查仪表是否出现问题,大大降低了人类的操作成本。

Santiago 的实践从一个很好的角度回答了一个被广泛讨论的问题:ChatGPT 一类的大语言模型到底有什么意义?

一开始,人们认为 ChatGPT 就是一个单纯文本生产式 AI,它有着比较强的自然语言理解能力,可以写文章、写报表,虽然不那么靠谱,但也算惊艳。

后来人们发现只要给 ChatGPT 恰当的指令,它可以代替人类自动得完成编程或者文字处理等工作,犹如一台基于自然语言运转的计算机。

OpenAI 发布了插件集功能后,ChatGPT 可以与许多互联网的应用结合在一起,把很多跨平台的操作用对话整合在了一起,变成了互联网的新入口。

微软发布的 Copilot 则启发了人们对下一阶段人机交互的想象:图形操作界面并不一定是永远合理的范式,许多我们习以为常的操作都可以被对话代替。

再回到 Spot 上时,我们就能比较清晰地看出大语言模型的意义:简化人机交互,赋予机器人更高级的智能。

无论是把 ChatGPT 当作新的互联网入口,还是当作控制具备学习能力、问题分析能力和执行高精度操作能力的工业机器人的遥控器,本质上都是把复杂的指令集变成自然语言,降低操作成本。

这种赋能将使未来的工业机器人不仅仅成为指令执行的工具,更能具备与人类大脑相当的智能水平。

就像图形界面把复杂的命令行变成了一个个直观的图标,现在点按不同图标的复杂操作又变成了一句简单的话,人类正在从图形用户界面走向一个新的阶段:自然语言用户界面。

在这个阶段,大语言模型将成为工业机器人的关键技术,它将简化人机交互,提高生产效率,进一步推动人类社会的科技发展。

并且在某些情况下,语言模型在理解语言时甚至会比人类表现得更好。普林斯顿大学的教授 Arvind Narayanan 在他一篇博客中提到了他的一个亲身案例。

Arvind Narayanan 为 ChatGPT 接上了语音交互,给自己快要四岁的女儿使用。就和所有孩子一样,他的女儿也充满好奇心,经常问 ChatGPT 各种问题。

让他感到意外的是,当他告知 ChatGPT 它在和一位小朋友说话时,ChatGPT 变得很善于表达同理心。

女儿:「关灯后会发生什么事?」

ChatGPT:「关了灯之后,会变得很黑,也可能会有点让人害怕。但不用担心!有很多东西能帮助你在黑暗中感到安全和舒适。」

《彭博社》专栏作家 Parmy Olson 指出,微软和 Google 都忙着把大模型用在搜索引擎上,但却没看到,和作为一个事实提供者相比,ChatGPT 更合适做情感陪伴者。

Olson 还让 ChatGPT 去做了情商测试,结果居然比她自己和同事都好。正因为 ChatGPT 是用网络上文字素材训练的,数据中会有大量错误信息,但这也让它更善于模仿共情。

这些案例都充分说明了,大语言模型对自然语言的理解能力其实有着很大的应用潜力。

借助如此强大的理解能力,我们可以利用大语言模型真正实现又一次的人机交互革新,同时大语言模型的出现为机器人的发展带来了新的可能性。大语言模型可以让机器人可以更好地理解和处理指令,更快地学习和适应新的任务和环境。

《纽约客》在封面文章 《黑暗工厂》(Dark Factory)中提到,目前工业机器人一个共同的难点,就是设计一个像人手一样的「末端执行器(end effector)」,让机器人能以不同的力度抓取大小形状各异的物体。

如果这个技术难题得到解决,机器人能完成更多精细的工作,很多领域自动化的程度也会大大提高。比如各种水果的采摘可以实现自动化,富士康的流水线也不再需要这么多工人了。

未来的工业机器人不仅仅应该是指令执行的工具,更应具备与人类大脑相当的智能水平,具备学习能力、问题分析能力和执行高精度操作的能力。

在工业生产线上,「肌肉发达」的工业机器人更加灵活高效,能够更好地应对各种生产问题,提高生产效率和质量。例如,在汽车制造领域,大语言模型可以为机器人赋予更强的智能和认知能力,使其能够更好地完成多样化的任务。

在医疗机器人领域,机器人可以通过自然语言处理技术与医生和病人进行交流,提供更好的医疗服务。

大语言模型为机器人行业带来了一颗强大的大脑,为机器人创造了出更泛化的应用场景,这很有可能会成为第四次工业革命的技术核心。而「语音版」Spot,便是这场技术变革迸发出的第一缕火花。

评论

所有评论

推荐阅读

  • Polymarket周一将发布重大公告

    3 月 21 日,Polymarket 团队成员 Mustafa 发文表示,将于周一公布一项「重大公告」,具体内容尚未披露。

  • Polymarket将于下周一公布重大消息,或为发币或融资相关消息

    Cointime 报道,3月21日消息,Polymarket 官方团队成员 Mustafa 于 X 平台发文表示,下周一即将公布重大消息。因推文内容包含硬币符号,社区猜测或为融资或代币发射相关重大消息。 此前消息,预测市场平台 Kalshi 与 Polymarket 据悉正与潜在投资者洽谈新一轮融资,目标估值均约为 200 亿美元。日前,Kalshi 已完成新一轮超 10 亿美元融资,估值达 220 亿美元,较去年 12 月上一轮融资时的 110 亿美元估值翻倍。知情人士透露,本轮融资由 Coatue Management 领投,Kalshi 目前的年化收入为 15 亿美元。

  • 美众议院金融服务委员会将于3月25日举行代币化听证会,聚焦资本市场未来

    3 月 21 日,美国众议院金融服务委员会将于美东时间 3 月 25 日 10:00 举行听证会,主题为「代币化与资本市场的未来」,预计将重点讨论区块链技术在金融体系中的应用与监管方向。

  • 黄金创43年来最大周跌幅:一周暴跌11%,避险属性遭质疑

    3 月 21 日,受中东局势升级及利率预期影响,黄金价格大幅下挫,创下自 1983 年以来最大单周跌幅。现货黄金周五跌至约 4488 美元/盎司,单周累计下跌约 11%,自 2 月底以来累计跌幅已超 15%。市场分析认为,美联储年内或维持利率不变、鲍威尔关于通胀上行的表态削弱了黄金吸引力。同时,在伊朗冲突背景下,比特币表现相对更强,期间反弹超 11%,对黄金形成对比。

  • 分析:加密市场山寨币交易量大幅下滑,市场兴趣持续降温

    3 月 21 日,Cryptoquant 分析师 Darkfost 发文称,加密市场山寨币交易量持续走低,投资者兴趣明显减弱。在熊市背景及地缘政治不确定性影响下,山寨币表现持续跑输比特币,风险偏好显著收缩。当前,Binance 山寨币日交易量约为 77 亿美元,其它主要交易所合计约 188 亿美元,远低于 2025 年 10 月与 2 月高峰期(Binance 曾达 400 亿至 500 亿美元,其它平台达 630 亿至 910 亿美元)。目前 Binance 占据约 40% 的市场份额。分析指出,历史上交易量高峰往往对应市场阶段性顶部与 FOMO 情绪释放,而当前低迷成交环境也意味着潜在机会通常出现在市场关注度最低阶段。

  • 消息人士:特朗普政府正制定方案以夺取伊朗核材料储备

    3 月 21 日,据美国哥伦比亚广播公司(CBS)报道,多位知情人士透露,特朗普政府一直在谋划获取或转移伊朗核材料的方法和选项。此时,由美国和以色列领导的针对伊朗的军事行动正进入一个更加不确定的阶段。关于特朗普是否会下令实施此类行动,目前时机尚不明确。一位消息人士表示,他尚未做出任何决定。但两位消息人士表示,相关规划的核心是可能部署来自联合特种作战司令部的部队,该部队是精英军事单位,常负责最敏感的防扩散任务。

  • 中东冲突与加息预期共振:全球资产大震荡,美股四连跌、债市「血洗」、黄金创43年最大周跌幅

    3 月 21 日,中东局势持续升级叠加 Federal Reserve 加息预期骤然升温,全球市场遭遇系统性冲击。美股连续第四周下跌创一年最长跌势,纳指单日跌超 2%,科技股全线承压;全球债市收益率大幅飙升,美债、英债、德债均创多年新高,资金大规模去杠杆。大宗商品剧烈分化,黄金跌破 4500 美元关口,单周暴跌超 10%,创 1983 年以来最大跌幅,避险属性遭质疑;原油则因中东供应风险暴涨,布油重返 110 美元上方,迪拜原油期货单日飙升超 16%。与此同时,比特币在 7 万美元附近获得支撑,连续三周跑赢黄金。市场分析认为,地缘冲突推升能源价格并加剧通胀预期,迫使货币政策路径重定价,全球金融条件快速收紧,风险资产仍处于下行与再定价过程中。

  • 美团开源560B参数定理证明模型:72次推理通过率97.1%,刷新开源模型SOTA

    据 1M AI News 监测,美团 LongCat 团队开源 LongCat-Flash-Prover,一个 5600 亿参数的 MoE 模型,专攻形式化定理证明语言 Lean4 的数学推理任务。模型权重以 MIT 协议发布,已上线 GitHub、Hugging Face 和 ModelScope。模型将形式化推理拆解为三项独立能力:自动形式化(将自然语言数学问题转化为 Lean4 形式语句)、草图生成(产出引理风格的证明框架)和完整证明生成。三项能力均通过 Agent 工具集成推理(TIR)与 Lean4 编译器实时交互验证。训练方面,团队提出 Hybrid-Experts Iteration Framework 生成冷启动数据,并在强化学习阶段引入 HisPO 算法稳定 MoE 模型的长程任务训练,同时加入定理一致性和合法性检测机制防止 reward hacking。基准测试显示,LongCat-Flash-Prover 在开源权重模型中刷新了自动形式化和定理证明两项 SOTA。MiniF2F-Test 上仅用 72 次推理即达 97.1% 通过率,ProverBench 和 PutnamBench 分别达到 70.8% 和 41.5%,每题推理次数不超过 220 次。

  • Erik Voorhees再次增持1.44万枚ETH,总持仓量突破11.7万枚

    3 月 21 日,据 AI 姨监测,ShapeShift 创始人、比特币早期支持者 Erik Voorhees 关联地址,过去 11 小时买入 14,424.53 ETH,总持仓突破 11.7 万枚,持仓均价 2,160.24 美元,当前浮亏 114.5 万美元。

  • 消息人士:特朗普政府正制定方案以夺取伊朗核材料储备

    Cointime 报道,3月21日消息,据美国哥伦比亚广播公司(CBS)报道,多位知情人士透露,特朗普政府一直在谋划获取或转移伊朗核材料的方法和选项。此时,由美国和以色列领导的针对伊朗的军事行动正进入一个更加不确定的阶段。 关于特朗普是否会下令实施此类行动,目前时机尚不明确。一位消息人士表示,他尚未做出任何决定。但两位消息人士表示,相关规划的核心是可能部署来自联合特种作战司令部的部队,该部队是精英军事单位,常负责最敏感的防扩散任务。(金十)