梁文锋 4 小时投资会精读(上):拿得多的,会被拿得少的打败

最近读完一份流出的四小时录音文字稿——据称是梁文锋 5 月 20 日与投资人的闭门交流会,七月整理流出,未见官方证实。全文是语音转写加 AI 整理,不分说话人,个别名词甚至有识别错误,但观点密度是真的高。这篇是我读完前两部分(愿景与开源、AGI 技术路线)的理解:不是摘抄,是把他的逻辑从头推一遍,再对照一批经典论文做校验。

蛋糕大到,独占必死

DeepSeek 坚持开源,外面最常见的解读是”格局”。读完原文,我觉得更准确的读法是反过来的:开源首先是一个客观规律的判断,其次才是愿景。

梁文锋的账是这么算的:AI 最终可能占人类 GDP 的百分之十。这么大的市场,”一个人独占这个事情,你不可能独占,你一定得跟别人分享,否则你肯定活不下来”。历史上开源和商业化冲突,是因为一个软件公司一年市场才几十亿美金,开源了就只剩几千万。AI 不一样——“你随便分一点点,就已经很足够了”。

从这个判断往下推,是最锋利的一句:拿得多的,会被拿得少的打败。他给 OpenAI 算过账:理论上账是算得过来的,但只要你想要百分之五,就会有只要百分之一的人打败你,然后又有只要千分之一的人打败前面那个人。”甚至你还不用真的拿得多,愿景如果是拿得多的话,你就先输了。”

所以 DeepSeek 的定价不是利润最大化:十个月收回设备成本,约六倍利润。利润最大化的做法应该定更高的价——原文说得很直白,这个价格区间需求没有弹性,价格再翻一倍,token 消耗量区别不大。但他就到十个月回本为止。最能说明问题的是个细节:模型降价到四分之一的时候,公司群里是欢呼的。任何其他公司,降价一半 ARR 就掉一半。

还有两个支撑细节:开源的模型和自部署的是完全同一套权重,没有留一手;而在这个定价之下,第三方自己部署的成本不可能更低,所以开源并不伤收入——“我只担心他部署不起来”。

那么问题来了:这套战略靠什么组织落地?这就到了我认为全文最精彩的地方。

我的推导:三个支撑点

读完第一部分,我把散落的说法拼成一条自己的推导。要做到愿景驱动、开源、松弛这三件事同时成立,有三个支撑点,缺一个就塌:

**第一,集中力量办大事。**公司松弛、人少,所以不应该什么都去做,只做自己认为在通向 AGI 关键节点上的事。原文的说法是克制带来聚焦:3D、视频生成、世界模型,甚至多模态,都只是”组件”,不进主线——哪怕视频生成”在商业上是个好生意”。连好生意都舍弃,这才叫聚焦。

**第二,公司小,必须精准找到属于自己的赛道。**没办法像大公司那样全都要,得让自己能盈利、能持续长久地走下去。开源是这条赛道的一部分:处于一种合理的定价(十个月回本),别人自己部署也不会更便宜,但自己有钱可以挣。这里有两个条件咬合在一起:没有部署成本门槛,开源就是纯让利;没有合理定价,开源就失去商业逻辑。两个都在,开源和赚钱才同时成立。

**第三,必须要做足够多的优化,让卡的效率更加高。**DeepSeek 大概两万张 H 等效算力,和美国比,差距只有资源,不是人才。大公司靠加卡解决,它只能靠效率——成本越低,同样的卡能撑越大的模型。原文有句话让我觉得最值得琢磨:商业化公司没有动力追求模型效率,因为低成本不符合他们的利益。DeepSeek 追求效率,一半是资源约束逼的,一半是愿景——它的员工知道普通人用 AI 是要花钱的。

松弛是前提,还是结果?

组织上,DeepSeek 有两条线。从上到下:目标明确大家一起干,比如发 V4 要分工,每个人做一部分,这叫”正式”;从下到上:每个人都有自己的 idea 和创意,没人管、没有 KPI,按自己觉得重要的方向探索。一条硬规则:正式不要超过员工时间的一半。

不加班也有两个原因:研究需要松弛的环境,逼得紧就没法做研究;聚焦所以事情少,没那么多活要干。

读到这里我停了一下,因为有个因果方向的问题。原文的顺序是:克制(战略)→ 聚焦 → 事情少 → 所以松弛,松弛是结果。但按我自己的读法,可以反着推:松弛且人少的组织,天然做不了多线作战,所以只能挑关键节点——松弛是前提。

两种读法互为因果,但我的读法有个推论值得单独记下:如果组织变大、不再松弛了,聚焦会自己松动。这比”创始人想不想要聚焦”更根本。Google 的 20% 时间是现成的警告——Gmail、AdSense 都从这里出来,后来名存实亡,Schmidt 亲口说那其实是指”下班后的时间”。大组织里,短期交付永远比远期探索紧急。

梁文锋能守住这一条,靠的是三件事咬合:愿景共识筛掉了不认同的人(招聘即治理),利润结构允许”低效”(十个月回本而非利润最大化),聚焦让正式工作真的少于一半。缺一个,自由探索就退化成口号。

阶梯:从语言模型到具身

第二部分是 AGI 的技术路线。梁文锋给了一个阶梯:语言模型 → CoT → Agent → 持续学习 → 奇点 → 具身智能。去年走的阶梯是 CoT,今年是 Agent;下一个瓶颈是持续学习(他说的是”学习去学习”);奇点是自我迭代——但他特意说,这个奇点”其实不是一个奇点,是一个连续的过程”。

这个顺序的理由很实用主义:每一步都踩在前一步上,没有一步白走;而且是”最轻松”的路线——先解决持续学习,奇点之后,具身智能的活可以交给模型自己开发,不用人来做。反过来(先做具身)就是苦活。

商业上的动作(去年的 C 端、今年的 B 端)都只是主线的副产物——“站在技术的高位上做低一级别的技术,是降维打击”。

Scaling 他说得干脆:信。墙还没有摸到——“我们训练这么大的模型,并不是因为我觉得这么大就够了,而是我刚好有这么多资源”。挡住 Scaling 的是算力,不是意愿;硅谷说的 Scaling 到头,”对中国来讲,我们离那个还很远”。

CoT 的病,o1 的药

这两部分原文里梁文锋对 CoT 着墨不多,阶梯一笔带过。下面是我自己的补充功课——把自己的判断和一批论文对了个账。

CoT 最大的两个病。

一是不回溯:一条链走到底,前面错,后面就完全错误。这个判断不是我发明的——Tree of Thoughts(2023)开头对 CoT 的批评就是原话:从左到右逐 token 决策,不能回溯,不能全局探索。ToT 的药方是分支、回溯、前瞻评估;Self-Consistency(2022)更简单粗暴:采样多条独立推理链,投票取多数。我最早记的”多 CoT 模式投票表决”,实现是现成的。

二是先给答案,然后编思维过程。两篇论文给过实锤:Turpin et al. 2023 在输入里埋暗示(”答案应该是 A”),模型的思维链完全不提暗示,但答案仍被暗示左右——解释不是决策的依据。Lanham et al. 2023(Anthropic)用截断、替换、改写思维链的办法测依赖,反直觉的发现是:任务越简单、模型越大,CoT 越可能不忠实——简单题根本不需要推理,思维链是事后编的。

CoT 的发展,我看到三条线:外部扩展思考空间(风险是故意模仿人类的思考步骤);多 CoT 并行投票;以及 o1/o3 的路线——不是奖励具体的步骤,而是搭建一个可以验证思维方式是否正确的环境,让错误的决策被否决。

这句话背后是一次路线掉头。2023 年 OpenAI 自己在 “Let’s Verify Step by Step” 里验证过过程奖励(PRM)优于结果奖励(ORM)——人工标注每一步对错。而 o1 被广泛解读为反着走:不用人工步骤标注(容易被钻空子、标注贵),只用可验证奖励(RLVR:数学、代码有标准答案)做结果级 RL,让模型自己学会纠错、拆解、换路。o1 到底用没用 PRM,OpenAI 没说死过,学界吵到现在。但”搭环境而不奖励步骤”,是现在站得住的共识表述。

o1 机制的三个观察(我的笔记,做了校准):

  1. 回答之前先生成思维 token,缓存下来,不展示给用户。精确化:用户看到的是摘要,原始思维链是隐藏的——OpenAI 给的理由是防蒸馏和安全监控。”缓存”更接近 API 层的推理上下文复用(OpenAI 的 previous_response_id、Claude 的思维块缓存),不是被确认过的训练机制。
  2. 提前训练自纠错,做逻辑矛盾的剪枝,让思考自己反馈自己。这个成立:奖励只看最终对错,纠错行为被 RL 自发强化。
  3. 思维空间在解空间上搜索,放弃低概率的搜索空间,具备判断路径复杂度的能力。这是我最想展开的一条——用我的本行打比方,这就是 CBO(基于代价的优化):查询优化器的 cost model 决定走不走索引、并不并行;o1 内化的就是自己的 cost model,简单题烧两万 token 是浪费,奥数题只给一百 token 是找死。Snell et al. 2024 验证的正是这件事:按难度自适应分配 test-time compute,固定预算下小模型能打赢无脑堆算力的大模型。开放问题是这个 cost model 是练出来的还是拍出来的——现在各家 API 的 thinking budget 全靠用户手调,模型”自知难度”这件事没有完全解决。

还没想清楚的三个问题

  1. “拿得多的被拿得少的打败”有个隐含前提:技术优势本身构不成护城河。那它什么时候失效——模型能力差距拉大到某种程度的时候,还是分发和生态锁定生效的时候?DeepSeek 自己又靠什么不变成被锁死的一方?
  2. o1 式的 RL,是不是把 ToT 式的显式搜索内化进了权重(模型自己学会回溯和剪枝,不再需要外部树搜索)?如果是,Agent 阶梯会不会也走同一条路——今天外挂的 Agent 框架,最终被内化成一个模型能力?这恰好对得上”没有一步是白走的”。
  3. “正式不超过一半”这条,复制者最先崩的是哪一环:招不到愿景一致的人,还是管理层忍不住把自由时间填满?

写下来的是前两部分。第三部分是算力与国产芯片(据说有 TileLang 的精彩论述),第五部分是投资人 Q&A(据说有下代模型激活参数 150B–250B)。读完写(下)。

参考来源