Cointime

扫码下载App
iOS & Android

AGI的多模态、多模型以及Multi-everything的未来

本文作者:swyx;编译:Cointime Freya

GPT-4的FOMO解药,以及对Moravec悖论的沉思

正如传闻所说,以及微软德国公司随后证实的那样,近日,GPT-4在ChatGPT中发布了博文、论文、现场直播和几个短视频:

GPT-4是有史以来第11个最受赞誉的黑客新闻故事,Developer Livestream在20小时内获得了150万次观看(目前在YouTube总排名中排名第五),公告推文获得的点赞数是ChatGPT的4倍,要知道,ChatGPT本身就是2022年最大的故事。

很多屏幕截图和糟糕内容的镜头被到处转发,所以,我认为,就像对ChatGPT所做的执行摘要一样,我应该对GPT-4也做一次回顾,是很有必要的。

GPT-4执行摘要

GPT-4是OpenAI旗舰语言模型的最新版本。它是:

  • 在现有的GPT-3任务方面有明显的改进(这个改进体现在对标准NLP基准测试和SAT/GRE等人类考试上的显著改进,并且指令更好的遵循和更好的世界知识)。
  • 能够胜任新的任务(比如,知识储备的量足够到可以来计算个人税收,并不比Minerva差!)。
  • 能够存储比ChatGPT多8倍的上下文信息(2.5万字的上下文意味着,通过简单地复制粘贴文档就可以解锁更好的人工智能编程,或者粘贴整个维基百科的文章,甚至是比较两篇文章,从而实现来更好地交流)。
  • 使用起来更安全(胡言乱语和不安全内容减少20-30%)。

仅此一项就足以证明它是一个海量版本,但GPT-4也是OpenAI的第一个多模态模型,能够原生理解图像输入与文本。这比现有的OCR和图像转文本(例如BLIP)解决方案要好得多,你必须亲眼目睹才能完全理解,但你必须了解的功能包括:

  • 将网站草图转换为代码;
  • 完整描述Discord应用程序的截图;
  • 总结一篇论文的图像并回答有关数字的问题;
  • 识别照片(冰箱、厨房),提供饮食建议;
  • 解释图像为何有趣(熨衣服,鸡块,备忘录)。

仅此一项就足以证明它是一个海量的版本,但GPT-4也是OpenAI的第一个能够原生理解图像输入与文本的多模态模型。这比现有的OCR和图像转文本(例如BLIP)的解决方案要好得多,可能需要你亲眼目睹才能完全理解我刚才说的那些优点,必须了解的功能包括:

  • 将网站草图转换为代码;
  • 完整描述Discord应用程序的截图;
  • 总结一篇论文的截图并回答有关数据的问题;
  • 识别照片(冰箱、厨房),提供饮食建议;
  • 分析图像为何有趣(熨衣服,鸡块,备忘录)。

现在,获得获得GPT-4文本API访问权限的方式需要满足两点:成为ChatGPT Plus的订阅者(20美元/月),并通过等候名单或贡献OpenAI Eval。目前,多模态视觉API功能是BeMyEyes独有的功能。API定价现在分为提示代币和完成代币,比GPT-3.57高30-60倍。

与以往不同的是,OpenAI以竞争和安全问题为由,拒绝公布GPT-4的任何技术细节。这意味着Small Circle、Big Circle(原文是meme吗?)既没有被证实,也没有被否认,因此,对OpenAI不开放的另一轮批评又开始了:

  • 已知的:GPT-4的训练于2年前开始,到2022年8月结束,GPT-4的数据截止日期是2021年9月。
  • 未知的:数据、计算、硬件、参数或训练过程是如何从GPT-3改变的。

除了技术细节,OpenAI还专注于演示功能(如上所述)、扩展和安全研究(由OpenAI的Alignment Research Center完成),并在一次令人印象深刻的协调发布中,与发布合作伙伴演示用例(在发布当天提供了完整的GPT-4构建示例):

  1. 微软确认Prometheus就是他们的GPT-4代号,这意味着所有Bing/Sydney的用户都是真正的GPT-4用户,还增加了Bing的查询限制。
  2. Duolingo展示了西班牙语和法语的“给我的答案一个解释”和“角色扮演”的新功能(当然GPT-4也可以说许多其他语言)。
  3. Stripe测试了15个用例,包括支持定制、回答文档问题和欺诈检测。
  4. Intercom推出了他们的Fin聊天机器人,它可以减少无根据的答案(包括关于竞争对手的无根据的答案),消除歧义,并将其交给人类代理。

竞争动力学。GPT-4并不是周二发布的唯一一个基础模型,它协调的范围其实超越了OpenAI。谷歌和Anthropic都推出了它们的PaLM API和Claude+模型,Quora Poe是第一个同时发布OpenAI GPT-4和Anthropic的Claude+模型的应用程序。各公司在Pi Day上的发布周期竞争的异常激烈,有点像上个月谷歌与微软进行的特殊活动竞赛,引发了人们对人工智能安全的担忧。

多模态与多模型的人工智能之年

GPT-4的多模态是AGI未来的一个缩影。它没有符合大众的预期——它没有图像输出,并且由于Whisper API的发布,音频在可接受的输入中明显的缺失,但Jim Fan在这里的英雄形象大多是准确的:

然而,就在三天前,微软中国研究院发布了另一种使用Visual ChatGPT的多模态方法,可以实现像GPT-4一样,与图像进行交流。

这是一个多模态项目,更准确地说,这是一个多模型项目,因为,实际上,它的核心是:“trenchcoat中的22个模型”。

这暗示了实现多模态的两种方式——廉价的方式(将模型链接在一起,可能会使用LangChain)和“正确”的方式(训练和嵌入混合模态数据集)。我们有理由相信,多模态训练比单模态训练更有优势。就像在语言模型训练中添加代码语料库可以改善非代码自然语言的结果一样。我们可能会发现,对人工智能进行教学可以提高他们描述它的能力,反之亦然。

但多模型也被证明是有用的。Quora创始人Adam D'Angelo选择在OpenAI GPT-4和Anthropic Claude的支持下推出他的新Poe机器人,前GitHub首席执行官Nat Friedman建立了nat.dev,来帮助比较最大范围内的文本模型的输出:

Eliezer Yudkowsky也评论说,多模型对于模型的提炼很有用,最近斯坦福Alpaca的结果以GPT-3为基础,对Meta的LLaMa进行了微调,以使用缩小25倍的模型获得了类似的结果。

这似乎是一个富有成果的开发领域(如Palm-E、Kosmos-1、ViperGPT等),我预计多模式、多模型的开发将主导研究和工程周期,使我们越来越接近AGI的视域。

AGI = Multi-everything和Moravec悖论

Moravec悖论可以被概括为“计算机发现了人类难以发现的简单的事情,反之亦然”。但是人类能力的进化速度比计算机大约慢10万倍,而计算机从亚人类到超人类的进化并不需要很长时间。这不是一个新鲜的理论。LLM毫不费力地掌握多种语言(跨越最流行的人类语言和编程语言,但也越来越多地使用资源较少的语言的情况)和多学科(GPT-4同时能够成为调酒师、法学院学生、医学生和程序员,尽管英语文学是安全的)。

而这仅仅是我们能想到的两个维度。OpenAI ARC和Meta FAIR测试了人工智能的两面性,我们越来越多地看到,人工智能毫不费力地拥有多重人格——最近,Waluigi效应作为一种正式的速记方法进入了人工智能的讨论范围,Bing的Sydney表现出了令人不安的另类人格,这些人格分别被称为 Venom和Dark Sydney。然而,这只是开始。

人工智能没有义务以我们期望的方式多面化发展。我想起了电影《她》的结局,当Joaquin Pheonix得知Samantha同时爱上了641个人时,这个数字大到让他难以置信,但对于一个多元的人工智能来说,爱一个人只是一种功能。

*本文由CoinTime整理编译,转载请注明来源。

评论

所有评论

推荐阅读

  • Polymarket周一将发布重大公告

    3 月 21 日,Polymarket 团队成员 Mustafa 发文表示,将于周一公布一项「重大公告」,具体内容尚未披露。

  • Polymarket将于下周一公布重大消息,或为发币或融资相关消息

    Cointime 报道,3月21日消息,Polymarket 官方团队成员 Mustafa 于 X 平台发文表示,下周一即将公布重大消息。因推文内容包含硬币符号,社区猜测或为融资或代币发射相关重大消息。 此前消息,预测市场平台 Kalshi 与 Polymarket 据悉正与潜在投资者洽谈新一轮融资,目标估值均约为 200 亿美元。日前,Kalshi 已完成新一轮超 10 亿美元融资,估值达 220 亿美元,较去年 12 月上一轮融资时的 110 亿美元估值翻倍。知情人士透露,本轮融资由 Coatue Management 领投,Kalshi 目前的年化收入为 15 亿美元。

  • 美众议院金融服务委员会将于3月25日举行代币化听证会,聚焦资本市场未来

    3 月 21 日,美国众议院金融服务委员会将于美东时间 3 月 25 日 10:00 举行听证会,主题为「代币化与资本市场的未来」,预计将重点讨论区块链技术在金融体系中的应用与监管方向。

  • 黄金创43年来最大周跌幅:一周暴跌11%,避险属性遭质疑

    3 月 21 日,受中东局势升级及利率预期影响,黄金价格大幅下挫,创下自 1983 年以来最大单周跌幅。现货黄金周五跌至约 4488 美元/盎司,单周累计下跌约 11%,自 2 月底以来累计跌幅已超 15%。市场分析认为,美联储年内或维持利率不变、鲍威尔关于通胀上行的表态削弱了黄金吸引力。同时,在伊朗冲突背景下,比特币表现相对更强,期间反弹超 11%,对黄金形成对比。

  • 分析:加密市场山寨币交易量大幅下滑,市场兴趣持续降温

    3 月 21 日,Cryptoquant 分析师 Darkfost 发文称,加密市场山寨币交易量持续走低,投资者兴趣明显减弱。在熊市背景及地缘政治不确定性影响下,山寨币表现持续跑输比特币,风险偏好显著收缩。当前,Binance 山寨币日交易量约为 77 亿美元,其它主要交易所合计约 188 亿美元,远低于 2025 年 10 月与 2 月高峰期(Binance 曾达 400 亿至 500 亿美元,其它平台达 630 亿至 910 亿美元)。目前 Binance 占据约 40% 的市场份额。分析指出,历史上交易量高峰往往对应市场阶段性顶部与 FOMO 情绪释放,而当前低迷成交环境也意味着潜在机会通常出现在市场关注度最低阶段。

  • 消息人士:特朗普政府正制定方案以夺取伊朗核材料储备

    3 月 21 日,据美国哥伦比亚广播公司(CBS)报道,多位知情人士透露,特朗普政府一直在谋划获取或转移伊朗核材料的方法和选项。此时,由美国和以色列领导的针对伊朗的军事行动正进入一个更加不确定的阶段。关于特朗普是否会下令实施此类行动,目前时机尚不明确。一位消息人士表示,他尚未做出任何决定。但两位消息人士表示,相关规划的核心是可能部署来自联合特种作战司令部的部队,该部队是精英军事单位,常负责最敏感的防扩散任务。

  • 中东冲突与加息预期共振:全球资产大震荡,美股四连跌、债市「血洗」、黄金创43年最大周跌幅

    3 月 21 日,中东局势持续升级叠加 Federal Reserve 加息预期骤然升温,全球市场遭遇系统性冲击。美股连续第四周下跌创一年最长跌势,纳指单日跌超 2%,科技股全线承压;全球债市收益率大幅飙升,美债、英债、德债均创多年新高,资金大规模去杠杆。大宗商品剧烈分化,黄金跌破 4500 美元关口,单周暴跌超 10%,创 1983 年以来最大跌幅,避险属性遭质疑;原油则因中东供应风险暴涨,布油重返 110 美元上方,迪拜原油期货单日飙升超 16%。与此同时,比特币在 7 万美元附近获得支撑,连续三周跑赢黄金。市场分析认为,地缘冲突推升能源价格并加剧通胀预期,迫使货币政策路径重定价,全球金融条件快速收紧,风险资产仍处于下行与再定价过程中。

  • 美团开源560B参数定理证明模型:72次推理通过率97.1%,刷新开源模型SOTA

    据 1M AI News 监测,美团 LongCat 团队开源 LongCat-Flash-Prover,一个 5600 亿参数的 MoE 模型,专攻形式化定理证明语言 Lean4 的数学推理任务。模型权重以 MIT 协议发布,已上线 GitHub、Hugging Face 和 ModelScope。模型将形式化推理拆解为三项独立能力:自动形式化(将自然语言数学问题转化为 Lean4 形式语句)、草图生成(产出引理风格的证明框架)和完整证明生成。三项能力均通过 Agent 工具集成推理(TIR)与 Lean4 编译器实时交互验证。训练方面,团队提出 Hybrid-Experts Iteration Framework 生成冷启动数据,并在强化学习阶段引入 HisPO 算法稳定 MoE 模型的长程任务训练,同时加入定理一致性和合法性检测机制防止 reward hacking。基准测试显示,LongCat-Flash-Prover 在开源权重模型中刷新了自动形式化和定理证明两项 SOTA。MiniF2F-Test 上仅用 72 次推理即达 97.1% 通过率,ProverBench 和 PutnamBench 分别达到 70.8% 和 41.5%,每题推理次数不超过 220 次。

  • Erik Voorhees再次增持1.44万枚ETH,总持仓量突破11.7万枚

    3 月 21 日,据 AI 姨监测,ShapeShift 创始人、比特币早期支持者 Erik Voorhees 关联地址,过去 11 小时买入 14,424.53 ETH,总持仓突破 11.7 万枚,持仓均价 2,160.24 美元,当前浮亏 114.5 万美元。

  • 消息人士:特朗普政府正制定方案以夺取伊朗核材料储备

    Cointime 报道,3月21日消息,据美国哥伦比亚广播公司(CBS)报道,多位知情人士透露,特朗普政府一直在谋划获取或转移伊朗核材料的方法和选项。此时,由美国和以色列领导的针对伊朗的军事行动正进入一个更加不确定的阶段。 关于特朗普是否会下令实施此类行动,目前时机尚不明确。一位消息人士表示,他尚未做出任何决定。但两位消息人士表示,相关规划的核心是可能部署来自联合特种作战司令部的部队,该部队是精英军事单位,常负责最敏感的防扩散任务。(金十)