刚刚曝光的Claude3,直击OpenAI最大弱点

作为 OpenAI GPT3 研发负责人的创业项目,Anthropic 被视为最能与 OpenAI 抗衡的一家创业公司。当地时间周一,Anthropic 发布了一组 Claude 3 系列大模型,称其功能最强大的模型在各种基准测试中均优于 OpenAI 的 GPT-4 和 Google 的 Gemi

作为 OpenAI GPT3 研发负责人的创业项目,Anthropic 被视为最能与 OpenAI 抗衡的一家创业公司。

当地时间周一,Anthropic 发布了一组 Claude 3 系列大模型,称其功能最强大的模型在各种基准测试中均优于 OpenAI 的 GPT-4 和 Google 的 Gemini 1.0 Ultra。

但是,能处理更复杂的推理任务、更智能、更快响应,这些跻身大模型 Top3 的综合能力只是 Claude3 的基本功。

Anthropic 致力于成为企业客户的*拍档

这是首先体现在 Claude3 是一组模型:Haiku、Sonnet 和 Opus,让企业客户根据自身场景选择不同性能、不同成本的版本。

其次,Anthropic 强调自家模型是最安全的。Anthropic 总裁 Daniela Amodei 介绍,在 Claude3 的训练中引入了一种叫做「宪法人工智能」的技术,增强其安全、可信、可靠

在看完 Claude3 的技术报告后,爱丁堡大学大模型和推理方向博士生符尧称,Claude3 在一些复杂推理的基准测试上表现尤其显著,尤其在金融和医疗领域,作为一家 ToB 公司,Anthropic 选择优化最挣钱的领域。

现在,Anthropic 在 159 个国家开放使用 Claude3 系列的两款模型(Haiku和 Sonnet),最强版本 Opus也即将推出。同时,Anthropic 也通过亚马逊和谷歌的云平台提供服务,后者曾分别向 Anthropic 注资 40 亿美元和 20 亿美元

刚刚曝光的Claude3,直击OpenAI最大弱点

联合创始人 Dario Amodei and Daniela Amodei 表示,Claude 3 的发布再次表明,「Anthropic 更像是一家企业公司,而不是一家消费者公司。」|图片来源:Anthropic

01

更智能、响应更快的 

Claude3 家族:

Opus、Sonnet 和 Haiku

据 Anthropic 官网,Claude3 是一系列模型,包含三种*进的模型:Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus,允许用户为其特定应用选择智能、速度和成本的*平衡。

在模型的通用能力上,Anthropic 称 Claude 3 系列「为广泛的认知任务树立了新的行业基准」,在分析和预测、细致内容的生成、代码生成以及西班牙语、日语和法语等非英语语言对话方面,现实出更强大的能力,在任务响应上也更及时。

其中,Claude 3 Opus 是这组模型中最智能的模型,尤其在高度复杂的任务处理上。Opus 在大多数常见的评测基准中都优于同行,包括本科水平专家知识 (MMLU)、研究生水平专家推理 (GPQA)、基础数学 (GSM8K) 等。它在复杂任务上表现出接近人类水平的理解力和流畅性,是目前 Anthropic 对于通用智能最前沿的探索,「展示了生成式人工智能的外部极限」。

刚刚曝光的Claude3,直击OpenAI最大弱点Claude3 模型家族|图片来源:Anthropic

Claude 3 Sonnet 在智能水平和响应速度之间实现了理想的平衡,尤其对于企业场景下的任务。与同类产品相比,它以更低的成本提供了强大的性能,并且专为大规模人工智能部署中的高耐用性(high endurance)而设计。对于绝大多数工作负载,Sonnet 的速度比 Claude 2 和 Claude 2.1 快 2 倍,且智能水平更高。它擅长执行需要快速响应的任务,例如知识检索或销售自动化。

Claude 3 Haiku 是最紧凑的模型,并且也*成本效益。并且,它的响应速度也很快,可以在不到三秒的时间内阅读 arXiv 上包含图表、图形的信息以及数据密集的研究论文(约 10k token)。

02

瞄准企业客户的迭代

联合创始人 Daniela Amodei 介绍,除了通用智能的进步,Anthropic 特别关注企业客户把生成式 AI 集成到他们的业务时,所面临的许多挑战。针对企业客户,Claude3 家族在视觉能力、准确性、长文本输入和安全方面,都有进步。

很多企业客户的知识库拥有多种格式,PDF、流程图或演示幻灯片。现在,Claude 3 系列模型可以处理各种视觉格式的内容,包括照片、图表、图形和技术图表。

Claude3 还优化了准确性和长文本窗口的能力。

在准确性上,Anthropic 使用了大量复杂的事实问题来针对当前模型中已知的弱点,将答案分为正确答案、错误答案(或幻觉)和承认不确定性。相应地,Claude3 模型表示它不知道答案,而不是提供不正确的信息。其中最强的版本 Claude 3 Opus 在具有挑战性的开放式问题上的准确性(或正确答案)上,比 Claude 2.1 提高了一倍,同时也减少了错误答案的水平。

刚刚曝光的Claude3,直击OpenAI最大弱点

相比 Claude2.1 版本,Claude3 系列全面提升了响应的准确性。|图片来源:Anthropic

同时,由于语境理解能力的提升,Claude3 家族相比之前的版本,在响应用户任务上会作出更少的拒绝回答。

除了更准确的回复,Anthropic 称将在 Claude 3 带来「引用功能,可以指向参考材料中的精确句子来验证他们的答案

当前,Claude 3 系列模型将提供 200K token 的上下文窗口。后续,所有这三种模型都能够接受超过 100 万 token 的输入,这部分能力会提供给需要增强处理能力的精选客户。Anthropic 在技术报告中简单阐述了 Claude3 的上文本窗口能力,包括有效处理更长的上下文提示词,以及回忆能力。

03

「宪法人工智能」,

应对「不精确的科学」

值得注意的是,Claude3 作为多模态模型,可以输入图像,但无法输出图像内容。联合创始人 Daniela Amodei 称,这是因为「我们发现企业对图像的需求要少得多」。

Claude3 的发布是在谷歌 Gemini 生成图片引发争议后发布的,面向企业客户的 Claude 也免不了在 AI 所引发的价值观偏见等问题上的控制与平衡。

对此,Dario Amodei 强调了控制人工智能模型的难度,称其为「不精确的科学」。他表示,该公司有专门的团队致力于评估和减轻模型带来的各种风险。

另一位联合创始人 Daniela Amodei 也承认,用目前的方法可能无法实现完全无偏见的人工智能。「创建一个完全中立的生成式人工智能工具几乎是不可能的,不仅在技术上,而且还因为并不是每个人都同意什么是中立。」她说。

刚刚曝光的Claude3,直击OpenAI最大弱点

此前,Anthropic 公布了用来对齐大模型的「宪法人工智能」|图片来源:Anthropic

尽管如此,Anthropic 用一种称为「宪法人工智能」方法来尽可能使模型和人类广泛的价值观一致,模型遵循「宪法」中定义的原则来调整优化。

作为 OpenAI 曾经的核心人发人员,Amodei 兄妹的出走跟近日马斯克对 OpenAI 的一纸诉状有相同点,认为 OpenAI 不再是一个非赢利组织,不再遵循最初使命造福人类。有记者问 Amodei,Anthropic 符合你出走创业的愿景吗?

Amodei 说:「处于人工智能发展的前沿,是引导人工智能发展轨迹为社会带来积极成果的最有效方式。」

(0)
小多多的头像小多多创始人

相关推荐

  • 50亿,一支新一代信息技术产业基金落地湖州

    50亿,一支新一代信息技术产业基金落地湖州,基金规模50亿元,重点投向数字安防与网络通信、光通信等领域,涵盖南太湖新区半导体、南浔光电通信产业“万亩千亿”新产业平台。

    创投 2023年5月19日
  • 没有投决权的合伙人,干起了招商

    “苏总,我们确实想投您的项目,但是不迁注册地址,没办法打款呀,您再综合评估考虑一下吧,苏州那边给的政策真不错……”这句话来自北京某人民币基金的合伙人李力(化名),他明明是手握资金的甲方,语气却卑微得像个乙方。李力并非该基金的创始合伙人,他是“上个周期”的佼佼者,踩上了互联网的红利,投出了几个纳斯达克

    2023年12月7日
  • 「慢就业」的年轻人:找到工作了,有编制,但我不想去

    01、“毕业即就业”的紧张节奏,被放缓了不足十平的空间里,一张白色书桌撑起了房间主人的生活重心——教辅书和打印资料铺得满满的,放不下的都堆到了地下。墙上贴了几张便利贴,写满公务员和事业编制考试的知识点。但明显这个房间的主人并不完全醉心学习。置物架上还立着三只天线宝宝和冰墩墩的手办,下层夹着《房思琪的

    2023年8月18日
  • 烧钱的大模型,难救猎豹移动

    2024年伊始,两个科技大佬的一场“世纪大和解”,刷屏了互联网人的朋友圈。“傅盛作为年轻人的时候,火气比较旺,犯了一些错误。但现在不一样,现在的傅盛,我觉得有了很大改变。今年45岁的傅盛已经比17岁、34岁时候有很大的进步。”周鸿祎表示。此时,距离2008年傅盛签署竞业协议离开奇虎、周傅二人决裂,已

    2024年1月24日
  • 数禾科技CDO王冠军出席观远数据智能决策峰会,分享语义BI数据民主化进阶之路_行业动态

    数据分析是赋能企业数字化的关键点。在数据进阶的过程中,会遇到各种各样的问题,数据如何取?数据维度够不够?数据安全如何考量?对于金融企业,如何更好地将数据赋能一线,实现数据提效?在近日收官的「观远数据 2023 智能决策峰会暨产品发布会」现场,数禾科技CDO王冠军为与会观众详细阐述了公司在数据民主化

    2023年11月16日 创投
  • 自免一哥,要换人了

    GLP-1药物的风头,预估短期内无人可以撼动。在GLP-1的光芒之下,一个药物领域的机会也在闪闪发光。2023年全球TOP10畅销药物榜单几近出炉,司美格鲁肽以接近翻倍的变态增速傲视群雄之外,自免药物度普利尤单抗也以33%的增速迅速爬升,随着艾伯维修美乐的专利悬崖效应日益放大,登顶“自免药王”也仅是

    2024年3月7日 创投
  • 苹果,消灭「钉子户」!

    苹果,消灭「钉子户」!,手机厂商与其费尽心思消灭“钉子户”,不如好好利用新技术进行更多创新。

    2023年6月19日 创投
  • 2024,AI会让世界更「糟」吗?

    晚上,科技公司白领琼回到家,正准备选部好剧享受美好的睡前时光,一部名叫《琼糟透了》的新剧吸引了她的目光——剧中主角“琼”从名字到造型都和“琼”一样。不仅如此,琼白天经历的一切,都被拍到了剧中,甚至还遭到了“恶意演绎”。琼迅速找到律师,准备发起控告。但她惊讶地发现,不管是电视台还是剧中饰演自己的演员,

    2024年2月23日
  • ​“原油宝”事件落下帷幕,哪些投资品可能出现倒亏?

    大家好,这里是“希财课堂每日读财”,我是大财师兄,本期和大家分享的主题是“原油宝”。 原油作为一种大宗商品,如今已经不单纯是一种商品,还成了一种投资产品。全世界有大量的投资者,都参…

    创投 2022年3月31日
  • 新茶饮的2023:内卷上头的一年

    2023年,是新茶饮更“内卷”的一年。经历三年疫情重创后,今年消费市场迎来全面复苏口号,不过“报复性消费”似乎未在茶饮市场内体现。理性与健康消费风潮涌起,茶饮中高糖、高脂、高反式脂肪酸等存疑特性也遭到越来越多消费者的质疑。新茶饮品牌们不得不更卷向现制茶饮品类,更健康养生的“原叶茶+鲜奶+新鲜水果”茶

    2023年12月27日
  • 视频号商业化和AI大模型还很远,游戏出海真的能成为腾讯新增长点吗?

    视频号商业化和AI大模型还很远,游戏出海真的能成为腾讯新增长点吗?,022年,也是腾讯的全球游戏发行品牌LevelInfinite的元年,其已在二次元手游品类上已经进行了大量的尝试,但说实话从结果上来看偶然性更大,并未形成壁垒。

    2023年3月27日 创投
  • 广东,「文旅直播间」常驻榜一大哥

    旅游收入高的省份,要么就是经济发达,要么就是自然及历史遗产景点,而广东,作为常年身居“文旅直播间”的榜一大哥,给出的答案则是:我全都有。如果要为2023年评选一批卷王,各地文旅局一定在榜单上。淄博文旅局局长大街上卖完烤串,哈尔滨阿城区文旅局局长又开始在冰雪大世界热舞。忙活的还不只是局长们,当河北文旅

    2024年2月18日 创投
  • 千亿巨头卖给韩国,即将退市

    “三十年河东,三十年河西”是商业世界的常态,但对发发奇(Farfetch)来说,这一天还是来得太快了。12月18日,韩国跨境电商平台酷澎(Coupang)宣布出资5亿美元,收购英国奢侈品电商平台发发奇及其关联公司资产。酷澎创始人兼CEO金范锡表示,发发奇证明了“在线奢侈品是奢侈品零售的未来”,酷澎也

    创投 2023年12月25日
  • 乡镇零食店生存实录

    “你敢信吗?我干个8个月的零食折扣店,前前后后亏进去70万”。来自苏州某地的零食折扣店老板孙伟无奈地表示。今年年初,孙伟因看到当地几家零食折扣店生意爆火,自己也萌生了开一家零食折扣店的想法。面对零食很忙、赵一鸣等头部折扣零食品牌高额的加盟费和营业额抽佣,以及这些品牌门店走“大牌引流,白牌盈利”模式的

    创投 2023年12月28日
  • 深圳30亿元新材料产业基金招GP

    关于公开遴选深圳市新材料产业基金管理机构的公告根据《深圳市人民政府关于发展壮大战略性新兴产业集群和培育发展未来产业的意见》和“20+8”产业集群“一集群一基金”战略部署,为进一步支持我市新材料产业集群发展,经市政府批准,由市财政局、市工业和信息化局指导,深圳市引导基金牵头发起设立深圳市新材料产业基金

    创投 2023年9月1日