Speechify创始人:为什么每个创业公司都该自建数据中心
从被所有云服务商拒绝,到自建GPU集群训练出全球排名第一的语音模型——Cliff Weitzman讲述了一个关于算力、成本与战略失误的真实故事。
一、一个反直觉的决定:买GPU,而不是租
2022年,Speechify的创始人Cliff Weitzman做了一个让很多人看不懂的决定:花费数千万美元购买英伟达GPU,自己搭建数据中心。
当时,几乎所有创业公司都在租用云服务。但他和哥哥算了一笔账:
一块H100显卡的购买价格约为3万美元。如果从AWS或Azure租用,每小时需要3.5到5美元。乘以24小时、365天,一年下来需要3.5万到5万美元。
“租一年的成本是购买价格的1.5倍。而硬件通常有三年的正常使用期,保修期结束后还能再用十年左右。”
从纯财务角度看,购买显然更划算。
但真正促使他做出决定的,是工程师们的行为方式。
“我们发现Speechify的工程师们非常节俭。他们在使用GPU时总是想着:‘天啊,我正在让公司损失数万美元。’”
他打了个比方:想象你是迈克尔·乔丹,你想进NBA,但你每小时都要支付20美元才能在篮球训练中心训练。那太糟糕了。你希望有一个可以随时使用的球场——事实上,你希望家里就有一个。
于是,他们买了第一批GPU。
二、训练与推理:两种完全不同的需求
很多人不理解,为什么不直接租用云服务?
Weitzman解释道,关键在于区分训练和推理。
训练时,你有一个假设,希望尽快得到答案。每过一分钟,你都在和其他人竞争。拥有处理速度快几个数量级的GPU,是巨大的优势。
推理时,比如Speechify将文本转换为语音,你不需要最顶级的显卡。一块旧一点的GPU也能在100毫秒内完成任务。“我可以随时使用这些较旧的GPU型号来进行推理运算。”
更重要的是,训练需要将大量GPU集群与海量内存连接在一起。“我不可能只从谷歌、微软那里租用软件,然后运行我想要的那种规模,因为我需要非常大的规模。”
他们需要将数据存储在旁边的存储卡上,让所有GPU同时访问。这种架构,租用方案根本无法满足。
三、供应链的现实:保险、冷却和一辆装满GPU的卡车
自建数据中心听起来简单,但实际操作中充满了细节。
首先,你需要租用数据中心的场地。数据中心提供网络连接、电力,以及物理工程师——他们把设备从卡车上卸下来,安装好,如果出现问题就解决它。
但最大的限制因素是电力。
“数据中心本身提供了网络连接功能,它提供了能量,而实际上这是目前最大的限制因素。”
其次是冷却。现在,液冷技术已经成为必然选择,因为空气冷却已经无法满足需求。但很多数据中心目前还没有获得液冷系统的安装批准。你需要购买所谓的“侧推车”,自己输入液体冷却信息,然后付费给数据中心的工作人员来安装。
然后是运输。
“现在在美国的某个地方,有一辆装有GPU的卡车。其价值就是一栋房子的价值。那应该会到达我的数据中心吧?如果卡车被击中,或者湿度太大,或者GPU被翻转了,我感觉自己好像失去了很多东西。”
保险非常重要。摊销金额的重要性也非常突出。
他还分享了一个真实的谈判故事:他们从法国订购了一批GPU,但迟迟没有到货。于是他对供应商说:“听着,我有个更好的交易。我要取消我们的合同了,因为你没有按时送达。”
“请记住,我支付的是数据中心使用空间的租金。如果显卡延迟了,我仍然需要支付那个空间的租金。”
这就是压力所在。最终,供应商按照承诺将设备寄到了。
四、算力分配的数学:80%自建,20%租用
有了自己的GPU集群后,如何分配算力?
Weitzman的模型是这样的:
以11月为基准(100%的使用量),10月会达到140%,因为那是他们最重要的月份。12月可能只有80%,因为大家都在家,但不一定在学习或工作。
“我可以占用正常使用量中的20%而已。让我来买下它吧,因为这是最划算的选择。”
“我会占用另外25%的带宽使用量,并且会与大型云服务提供商签订长期合同。剩下的部分,我会从那些大型云服务提供商那里租用所谓的‘实例资源’。”
这样,他既拥有了核心算力的控制权,又保留了应对峰值的灵活性。
五、最大的战略错误:错过了B2B
采访中,Weitzman反复提到一个让他后悔的决定。
2022年,他遇到了11 Labs的创始人。当时他住在伦敦,对这对创始人印象深刻。但他犯了一个错误。
“我不喜欢他们的策略。因为我认为,随着时间的发展,文本语音功能的API会逐渐被标准化。你很快就会到达可以调用该API的环节。在你的电脑上,然后在你的手机上查看,那么他们现在还在卖些什么呢?”
他当时认为,API会变成一种商品化的东西,不值得投资。
“所以,我不想涉足那件事,不过我犯了一个严重的错误。”
他没有意识到的是,像11 Labs这样的AI实验室,其意义在于持续不断的创新。你推出的第一个产品是你的楔子,然后你可以不断添加新的东西:
“如果你使用的是文本转语音功能,你创造了世界上最优秀的模型。现在,你可以尝试使用其他的声音了。现在,你可以加入情感因素了。现在你可以添加语音克隆功能了。现在你可以将语音转换为文本了。”
“这是我的错误。我想到有一个API,这个产品其实是个糟糕的策略,因为我认为它可能会变成一种可以商品化的东西。我还忘记了关于硅谷的核心论点,那就是硅谷始终在不断创新。”
他总结道:“失败的最佳方式就是不参与竞争。”
六、数据市场的逻辑:一次性交易,而非经常性收入
当被问及数据市场时,Weitzman给出了一个清醒的判断。
“关于数据市场的第一个需要理解的问题是:它并不是一种有序的体系。这不是年度经常性收入。每次都是一次性的交易而已。”
因此,数据的购买者无需再次从你那里购买这些数据。“所以这是一项非常冒险的事情。”
他以Mercor等公司的早期发展为例:他们未能立即获得大量资金,因为投资者对这种情况非常担忧。
但数据也有其独特价值。“你需要为这些损失提供赔偿。这也是他们之所以会从你这里购买,而不是自行采购的原因之一。”
“这是一项非常不错的生意,如果你能很好地完成这项工作,不过的话,你就需要成为一个非常出色的运营高手。你必须非常快。”
七、最重要的个人故事:用AI治愈罕见病
采访的最后,Weitzman分享了一个让他真正兴奋的领域——将AI应用于药物学和生物学。
他的一个家庭成员患有严重的自身免疫性神经炎症,已经忍受了六年。他从他身上连续15周、每周抽取血液样本,送到实验室进行基因组测序、蛋白质组学研究、RNA分析,然后与自我报告的生活质量数据和情绪变化进行比较。
“每天我都有大约六年的关于他的数据。我在GPU集群上运行它,我发现了许多医生都无法告诉我的事情。”
这种病被称为“孤儿病”,因为患这种病的人并不多。有一个关于这种疾病的Facebook群组。
“所以,我正在组织一些聚会活动。所有患有这种疾病的人,他们的基因组都需要进行测序。然后在一个庞大的GPU集群上对所有这些数据进行对比分析,以找出其中的表观遗传因素。它们之间有一个共同的线索。”
“我知道我会解决这种疾病的。在过去,我永远没有机会去做那样的事情。”
然后,他讲了自己的故事:8岁时,他还不会阅读。他的爸爸不得不打开一本书,朗读给他听。13岁时,他搬到了美国,不会说英语。他听完了《哈利·波特》的22本有声书,连续多次,直到能记住第一章的内容。
“我上的是那种质量稍差的高中,而且我并没有选择进入AP课程,因为我自己修改了很多拼写错误。我还需要训练自己阅读SAT英语部分的内容。我不会阅读那段文字。我会先阅读所有的答案,然后再去寻找真正的答案。”
后来,他进入了布朗大学,学习可再生能源工程——因为他不适合从事文学工作。
“技术解决了我的阅读障碍问题,同时也缓解了我的注意力缺陷多动障碍症状。这将会治愈我弟弟的疾病。而且,这种方法已经成功治好了我父亲的前列腺癌。”
“这就是让我感到兴奋的原因——实际上,每个人的生活质量都得到了提升。因为你们拥有这台神奇的机器,它能够处理一万亿次运算。你可以使用任意多的GPU来运行它,而且它能够解决我们难以解决的问题。”
“令人震惊的是,直到今天我们仍然存在一些孤儿病。也就是说,参与的人数太少,无法实现经济上的可行性。我们有能力尝试解决这个问题。”
结 语
Cliff Weitzman的故事不是一个关于技术的演讲,而是一个关于如何用算力解决真实问题的故事。
他自建数据中心,不是为了炫技,而是因为租用太贵、太慢、太受限。他错过了B2B,不是因为不够聪明,而是因为低估了持续创新的力量。他投身药物学,不是因为商业机会,而是因为他的家人正在受苦。
“你需要数据,你需要计算能力,而你需要去问好的问题。就像我说的,做出了10个正确的决定,每天一次。”
“或者关于实际产品的决策问题,你可以解决这些难题。简直太棒了。”
本文来自微信公众号“后浪进化星球”,作者:Mark,36氪经授权发布。















