OpenAI和谷歌最怕的,是一张「开源笑脸」

OpenAI和谷歌最怕的,是一张「开源笑脸」,这个力量就是「开源社区」,它才是谷歌和OpenAI最大的敌人。

「我们没有护城河,OpenAI 也没有。」

在最近泄露的一份文件中,一位谷歌内部的研究人员表达了这样的观点。这位研究人员认为,在这场激烈的 AI 竞赛中,虽然谷歌与 OpenAI 在你追我赶,但真正的赢家未必会在这两家中产生,因为有股第三方力量正在崛起。

这个力量就是「开源社区」,它才是谷歌和 OpenAI *的敌人。

而开源社区的顶流,当属 Hugging Face 了。作为一个 AI 领域的 Github,它提供了大量高质量的开源模型与工具,将研发成果*程度地惠及社区,极大地降低了 AI 的技术门槛,推进了 AI 的「民主化」进程。

它的创始人之一,Clément 还曾公开表示:「在 NLP 或者机器学习领域,最坏的情况,就是要与整个科学界和开源界竞争。因此,我们不再试图竞争,转而选择为开源界和科学界赋能。」

Hugging Face 创立于 2016 年,几年间连获 5 轮融资,目前估值已经飙到 20 亿美元,Github 上的星标数量已经超过了 9.8w,稳居热门资源库之列。

那么这家公司是做什么的?是如何逆袭成为开源界的「顶流」的? 它的发展模式又是怎样的呢?

1、NLP 开启逆袭之路

Hugging Face 是一家以自然语言处理 (NLP) 技术为核心的 AI 初创公司。

它是由法国连续创业者 Clément Delangue(曾创办笔记平台 VideoNot.es,媒体监测平台 mention 以及被 Google 收购的移动开发平台 Moodstocks 等项目)和 Thomas Wolf、Julien Chaumond 一起创办的,于 2016 年成立,总部设在美国纽约。

其中的两位创始人 Clément Delangue 和 Thomas Wolf 都是自然语言处理领域的专家。在不断推进 Hugging Face 的发展的过程中,他们被视为当代 NLP 领域的先锋。

他们创办 Hugging Face 的初衷,是为年轻人带来一个「娱乐型」的「开放领域聊天机器人」,就像科幻电影《Her》里面的 AI 那样,可以跟人聊天气、朋友、爱情和体育比赛等各种话题。大家可以在无聊的时候跟它聊八卦、问它问题、让它生成一些有趣的图片之类的事情。

也正因如此,Hugging Face 的名字来源于一个张开双手的可爱笑脸 emoji。

2017 年 3 月 9 号,Hugging Face App 在 iOS App Store 正式推出,就得到了不少关注,还拿到了包括 SV Angel、NBA 球星杜兰特等投资人在内的 120 万美元的天使投资。

为了训练这个聊天机器人的自然语言处理(NLP)能力,Hugging Face 构建了一个资源库来容纳各种机器学习模型和各种类型的数据库,包括帮助训练聊天机器人检测文本消息情绪、生成连贯的响应、理解不同对话主题等。

同时,Hugging Face 团队在 GitHub 上将此库的免费部分开源,目的是从用户共创中获得开发灵感。

到了 2018 年,Hugging Face 仍然不温不火,便开始免费在线分享应用程序的底层代码。这一举动立即收到了谷歌、微软等业内知名科技公司的研究人员的积极响应,他们开始将这些代码用于 AI 应用程序,这个笑脸 emoji 也开始被广大 AI 开发者们所熟知。

恰巧同年,谷歌推出基于双向 Transformer 的大规模预训练语言模型 BERT,开启了 AI 模型的「内卷时代」。

在这样的大环境下,Hugging Face 做起了提供 AI 模型的服务,随之迎来了自己的「黄金时代」。

它先是开源了 PyTorch-BERT;随即,又整合了它先前贡献的 NLP 领域的预训练模型,发布了 Transformers 库。

Transformers 库提供了数以千计的预训练模型,支持 100 多种语言的文本分类、信息抽取、问答、摘要、翻译、文本生成。借助 Transformers 库,开发者可以便捷地使用 BERT、GPT、XLNet、T5 、DistilBERT 等 NLP 大模型,来完成文本分类、文本总结、文本生成、信息抽取、自动 QA 等 AI 任务,节省大量的时间和计算资源。

简而言之,Transformers 库提供直接可用的模型,无需企业再度开发;因此,众多企业开始借助 Transformers 库,将模型应用到产品开发和工作流程中。

Transformers 库也因此迅速地流行起来,成为了 GitHub 史上增长最快的 AI 项目。

OpenAI和谷歌最怕的,是一张「开源笑脸」

图片来自于 Lux Capital

Hugging Face 的创始人之一 Clément Delangue 也不禁感慨,「我们发布东西时没有考虑太多,而社区的爆炸式增长甚至让我们感到惊讶。」

面对如此多的开发者,Hugging Face 顺理成章地建立了自己的社区,Hugging Face Hub;同时,调整产品战略,不再局限于自然语言处理,而是将机器学习的不同领域进行融合,探索创建新的用例,着手构建一套完整的开源产品矩阵。

截至 2023 年 4 月,Hugging Face 共享了 16,6894 个训练模型,2,6900 个数据集,涵盖 NLP、语音、生物学、时间序列、计算机视觉、强化学习等领域,搭建了完整的 AI 开发生态。

这大大降低了相关研究与应用的门槛,让 Hugging Face 成为 AI 社区*影响力的技术供应商。

目前,这些模型已经服务了数万家企业进行资源开发,帮助科研人员和相关从业人员更好地构建模型、更好地参与到产品和工作流程中,其中不乏 Meta、亚马逊、微软、谷歌等知名 AI 团队。

在资本市场,Hugging Face 也同样备受青睐。

在 2022 年 5 月,团队完成了由 Lux Capital 领投、红杉资本参投的 1 亿美元 C 轮融资,估值狂飙到 20 亿美元。

面对资本的追捧,Hugging Face 的创始人表现的极其冷静,表示拒绝了多个「有意义的收购邀约」,并且不会像 GitHub 那样出售自己的业务。关于 Hugging Face 的未来,它的创始人还有一些有趣的想法:「我们希望成为*家以表情符号上市的公司,而不是三个字母的股票代码。

2、AI 大模型的 Github

凭借开源获得了万众瞩目的 Hugging Face,也格外注重社区的建设,而刚刚诞生不久的 Hugging Face Hub,现在俨然已经成为 AI 开发者的大本营。

Hugging Face Hub 是一个探索、实验、合作,并建立机器学习技术的中心场所。在这里任何人都可以分享和探索模型、数据集等,大家轻松合作,共同构建机器学习模型,Hugging Face Hub 也因此被称做「机器学习之家」。

它是 Hugging Face 坚持「开源」的产物,也是它的核心。正如官网的宣传语所述:AI 社区,建设未来。

Hugging Face 的创始人曾公开表示「Hugging Face 的目标是通过工具和开发者社区,让更多的人使用自然语言处理工具,达成他们的创新目标,让自然语言处理技术更容易使用和访问。」

他还补充说,「没有任何一家公司,包括科技巨头,能够独自『解决 AI 问题』,而我们实现这一目标的*途径,是通过以社区为中心的方式,分享知识和资源。」

因此,公司致力于在 Hugging Face Hub 上建立*的模型、数据集、演示和指标的开源集合,以使每个人都能利用机器学习进行探索、实验、合作和构建技术,从而实现 AI「民主化」的目标。

目前,Hugging Face Hub 提供超过 12 万个模型(Models)、2 万个数据集(Datasets) 和 5 万个演示应用程序(Spaces),而且所有这些都是开源、公开、免费的。

Hugging Face Hub 对所有机器学习模型开放,并得到 Transformers 、 Flair、Asteroid、ESPnet、Pyannote 等自然语言处理库的支持,其中,最核心的自然语言处理库是 Transformers 库。

Transformers 库支持 PyTorch、TensorFlow 和 JAX 之间的框架互操作性,这确保了在模型生命周期的每个阶段使用不同框架的灵活性。而且,通过 Inference API(推理 API),用户可以直接使用 Hugging Face 开发的模型与数据集,进行推理、迁移学习,这让Transformers 框架在性能与易用性上达到业界*水平,彻底改变了深度学习在 NLP 领域的发展模式。

此外,该平台还提供了一些实用工具,如模型版本控制、测试集成、共享和协作等,可以帮助开发人员更好地管理和共享模型和数据集。

因此,在 Hugging Face Hub,任何开发者或者工程团队都可以通过接口,使用数千个模型的推理 API,轻松下载和训练*进的预训练模型,完成不同模式的常见任务,例如自然语言处理、计算机视觉、音频、多模态等,在几分钟内构建自己的机器学习驱动的应用程序,省去了从头开始训练模型,所需的大量时间和资源。

在此基础上,他们还可以在自己的账号下创建自己的仓库,用于存储和分享已经训练好的模型、数据集和脚本,同时与强大的社区分享交流,轻松协作完成 ML 工作流程。

简而言之,Hugging Face Hub 为研究者提供了一个平台,去展示那些他们想要分享的模型,测试他人的模型,以此来深入研究这些模型的内部架构,共同促进 ML 的发展。而此前,AI 对前端开发者来说似乎遥不可及,毕竟到目前为止,只有少数代码生成的 AI 系统向公众免费开放。

也正因如此,Hugging Face 决定在社区提供开源模型和 API 来改变这种状况,主动承担起 AI 科研走向应用的这个过程中复杂、细碎的工作,使得任何 AI 从业者都可以便捷地使用这些研究模型和资源。用 Hugging Face 自己的话来讲,他们所做的事情,就是要架起 AI 科研和应用之间的桥梁。

除了提供便利,Hugging Face 还积极采取措施强化 Hub 的安全性,确保用户的代码、模型和数据是安全的,让用户放心使用。

例如,在模型库配备模型卡,以告知用户每个模型的限制和偏见,从而促进这些模型被负责任地使用和开发;在数据集设置访问控制功能,允许组织和个人可以出于许可和隐私考虑,创建私人数据集,并且可以自行处理其他用户的访问请求。

还值得一提的是,为了进一步使自然语言处理技术「民主化」,Hugging face Hub 上还开设了 NLP 课程——Hugging Face course。

该课程将使用 Hugging Face 生态系统中的数据库(Hugging Face Transformers、Hugging Face Datasets、Hugging Face Tokenizers 和 Hugging Face Accelerate),讲解自然语言处理 (NLP) 的有关知识。它是完全免费的,甚至没有广告。

简而言之,Hugging Face Hub 就像是机器学习领域的 GitHub。一个由社区开发者驱动的平台,提供大量资源,让开发人员可以在机器学习(ML)模型、数据集和 ML 应用程序上,不断探索、创新和互相协作,通过分享知识和资源以加速和推进 AI 发展。

3、「开源」带动「商业」

那么问题来了,一家提供「平台社区」的「开源」公司,又是如何盈利的呢?

首先,「开源」就是一个正确的决定。

Hugging Face 凭借开源项目 Transformers,积累了巨大的影响力,聚集了广大开发者构建了庞大的社区 Hugging Face Hub,也赢得了客户与投资者的信任,这使得它的商业化转型水到渠成。

对此,红杉资本合伙人 Pat Grady 也表示,「他们优先考虑的是应用,而不是变现,我认为这是正确的做法。他们看到了 Transformer 模型在 NLP 之外的应用方式,看到了成为 GitHub 的机会,这不仅是面向 NLP,而且会延伸到机器学习的每个领域。」

而且,纵观过去十年,市场上初创公司的创业历程,会发现开源模式的商业可行性得到过有力的印证。像 MongoDB、Elastic、Confluent 等,都是收入增长最快的开源公司,它们都实现了盈收,并且还在市场中存活了下来。

Hugging Face 的创始人之一,Clément 也因此坚信,「初创公司可以通过某种方式为开放的社区赋能,此种方法产生的价值,比通过搭建一个专有工具,产生的价值高出上千倍。」

甚至公开表示,「考虑到开源机器学习的价值和它的主流地位,其使用量就是递延收入。机器学习会成为技术开发的默认方式,而且 Hugging Face 会成为这方面的头号平台,并创造出数十亿美元的收入。

因此,Hugging Face 选择了「开源带动商业」,这一商业化发展路径,并在 2021 年开始提供付费功能。

目前,Hugging Face 的盈利业务主要有三类:

付费制会员:提供更加优质的服务和社区体验,来获得收益;

数据托管:根据不同参数需求,提供不同的按小时收费托管服务;

AI 解决方案服务:目前的主打产品,围绕 NLP、Vision 等方向为客户提供定制化解决方案,以获得技术服务费用。

值得一提的是,从 2020 年开始,Hugging Face 就开始做面向企业的定制自然语言模型,并推出了包括 AutoTrain、Inference API & Infinity、Private Hub、Expert Support 等,针对不同开发者类型的个性化产品。

目前,1000 多家公司已经成为了 Hugging Face 的付费客户,主要是大型企业,包括英特尔、高通、辉瑞、彭博社和 eBay。

2021 年,Hugging Face 已经实现收入 1 千万美元,从数据上来看,Hugging Face 这套的「开源带动商业」的策略是成功的。

这也印证了 Hugging Face 的 CEO,Clément 所说的,「公司不需要从创造的价值中获取 100% 的红利,只需将其中 1% 的价值变现,但即便只是 1%,也足够让你成为一家高市值的公司。

简而言之,Hugging Face 凭借开源社区积累影响力,而后逐步向 SaaS 产品和企业服务拓展。这种渐进式的转型,让 Hugging Face 在开源和商业化之间,取得了良好的平衡,也是其能取得成功的重要原因。这种发展策略也让 Hugging Face 成为了 AI 界独树一帜的存在,并为其他 AI 初创公司树立榜样。

但是,开源生态也有它自己的软肋,因为商业化的发展很可能会伤害到自然生长的社区环境。对此,Hugging Face 的做法是加强对技术的管控,维护自己的开源生态;同时,向科研领域深挖。

「机器学习技术仍然还处于早期发展阶段,开源社区的潜力是巨大的。在未来 5 到 10 年,我们一定还会看到更多开源机器学习公司的崛起。」

Hugging Face 的 CEO Clément 说道。

(0)
小多多的头像小多多创始人

相关推荐

  • 产业基金接连出台,空天信息赛道机会来了

    产业基金接连出台,空天信息赛道机会来了,多地抢滩万亿“空天信息”赛道。面向浩瀚星辰,机会无限大,城市冲刺空天信息第一极的第一幕正开启。

    2023年5月12日
  • 报税什么意思 公司需要向税务部门上报纳税

    报税什么意思?据悉报税是指持抄税后的IC卡和报税资料到税务机关申报纳税。根据增值税防伪税控系统的设置,月初如果企业不执行抄税和报税,系统将自动锁定,影响企业的正常开票。 如果从字面…

    2022年1月25日
  • 面板行业的周期宿命接近消失

    作为高科技行业的代表之一,如今面板正在复制煤炭、钢铁等传统产业曾上演过的“供给侧改革”。过去几十年里,面板行业本身重资产、长周期、高成本的特性被投资者所熟悉,因此这个行业的周期属性被更多关注。但其高毛利、高科技、高成长的一面,则相对较少被感知到。实际上,目前面板产业的经营环境,与供给侧改革前后的煤炭

    2023年10月30日 创投
  • 光伏投资的「明牌」:聊聊MLPE

    光伏的早期投资是个很有意思的话题,抛砖引玉谈谈我们的一些思考:和锂电类似,光伏并不是个新事物,整个行业已经卷了十多年,集中度非常高,因此巨头之间为了保住各自的市场份额、争夺定价权,就注定不会安于只做产业链的一环,而必须要去切别人的蛋糕。所以这几年,光伏一体化的趋势非常明显,比如隆基通威原来都是做硅片

    创投 2023年8月28日
  • 壹邦联合三甲医院营养科医生团队进老年公寓,开展营养知识科普宣教_行业动态

    为弘扬尊老、敬老、助老的传统美德,关爱老人健康,宣传合理膳食和食养对防控疾病的重要意义,树立健康科学的生活理念。2023年5月19日,壹邦联…” />
    <meta http-equiv="Content-Type" content="text/html; charset=utf-8

    2023年5月23日 创投
  • 突然消失的游戏公司,200人规模一夜解散

    突然消失的游戏公司,200人规模一夜解散,尽管早有预感,但谁也没想到会这么快。甚至在解散的前一天,还有新人入职。

    创投 2023年4月27日
  • 从事铁基可吸收支架研发,元心科技完成超2亿元B轮战略融资

    投资界(ID:pedaily2012)9月11日消息,元心科技(深圳)有限公司(下称“元心科技”)顺利完成超2亿元B轮战略融资。本轮融资引入了共青城华屹、广发乾和等多家战略投资者,A轮投资人IDG、上海抱泉等继续跟投,现已完成B轮增资协议和股东协议的签署。本轮融资投资者将按增资协议的约定合计向元心科

    2023年9月11日
  • 全球首发,稳石机器人第五代多模态柔性AMR、无人叉车震撼登场!_行业动态

    一文看懂稳石机器人2023新品发布会亮点!10月31日,以“算法探见未来,创新引领多模态时代”为主题的2023稳石机器人第五代多模态新品发布会圆满落幕。本次活动邀请了众多业内专家、客户齐聚一堂,共同见证这一重要时刻。凝聚力无数努力与创新,稳石机器人携多款硬核新品重磅登场,万物向新 聚势而为向着智造

    2023年11月2日 创投
  • 车企利润拼杀,谁最依赖补贴?

    车企利润拼杀,谁最依赖补贴?,目前国内自主车企基本还没有躺倒在补贴之中。只是在竞争加剧以及“价格战”影响下,已经没有了舒适圈。

    创投 2023年7月4日
  • 存储芯片,果真回暖了

    受需求放缓、供应增加、价格竞争加剧等因素影响,存储芯片的价格在2022年最后两个季度均出现暴跌。根据TrendForce的最新数据显示,DRAM的平均价格继2022年第三季度暴跌31.4%之后,在第四季度的跌幅扩大到了34.4%。今年Q1,DRAM均价跌幅收敛至13%~18%,Q2 DRAM价格跌幅

    2023年10月11日
  • 降息通道已经打开

    肖立晟[1]、尤众元[2] 2021年年底的政治局会议和中央工作会议显示,当前中国经济面临经济下行压力,稳增长是当前政策制定者重视的议题。12月20日,央行授权全国银行间同业拆借中…

    2022年1月25日
  • 国泰君安证券厦门分公司正式运营_行业动态

    7月6日,聚合“五大金融”新优势、助推“四大产业”新跨越——国泰君安证券助力厦门经济高质量发展主题论坛暨厦门分公司启动运营仪式正式举行。厦门…” />
    <meta http-equiv="Content-Type" content="text/html; charset=utf-8

    2023年7月7日 创投
  • MCU巨头,殊途同归

    MCU+AI 加速器正在变得越来越流行。Yole称,尽管2022年全球通胀大幅飙升,半导体市场历经周期波动、需求低迷的窘境,但微控制器(MCU)市场在2022年仍然蓬勃发展,总体年收入增长25%。2023年来,许多供应商开始担心库存过剩,以及受到消费市场支出急剧下降和供应过剩导致平均销售价格和收入下

    2023年11月22日 创投
  • 日本汽车,大限将近

    2023 年 9 月 23 日,三十台刚驶下生产线的本田奥德赛在华南*的内陆港口——广州港新沙港码头装船发往日本。在新闻精彩劲爆程度丝毫不亚于娱乐圈的汽车圈,几台国产车运到海外这件事,平平无奇到让人连展开正文详情页的兴趣都提不起来。但,这条不起眼资讯的背后,却同时潜藏着中国汽车工业和日本汽车工业的两

    2023年10月13日 创投
  • 华熙集团赵燕将星空搬进美术馆,拉近大众与天文科学距离_行业动态

    宇宙,广袤无际;星空,遥远闪耀。几千年来,人类对于宇宙星空总有种不可抗拒的向往,探索的渴望也从未停止。从古至今,人类通过观察星空理解宇宙,一步步从仰望星空到走向太空。而随着科技进步、天文学的不断发展,普罗大众也逐渐有机会离星空更近一步,了解到星空*的魅力。近期,华熙集团旗下北京时代美术馆推出“星河

    创投 2023年9月1日