传 DeepSeek 一半核心研究员,都在标数据

一份广为流传、但官方未证实的梁文锋投资者交流会录音提出:当下把 AI 往前推的瓶颈,不是算力,也不是天才,而是耐心地把数据擦干净。

未核实 来源 Circulated recording transcript (unconfirmed by DeepSeek), via 36Kr / Jiemian / social ⚑ AI战略

60 秒版本

一份疯传、官方未证实的 DeepSeek 投资者交流会实录援引梁文锋:公司一半核心研究员在标数据,因为现阶段决定 AI 的是数据和品味,而非算力。

要点

  • 核心金句:约一半核心研究员在标数据;「现阶段解决 AI,靠的就是标数据」。
  • 瓶颈被重新定义:不是卡、不是天才,而是高质量数据 + 判断「好」的品味,再往后是时间。
  • AGI 像爬楼梯:去年思维链,今年 Agent,下一级是持续学习(今天的 AI 恰恰缺这个)。
  • 哲学:克制为战略、开源为让利、只赚合理利润、一半工作时间自由探索。
  • 背景:首轮外部融资,据称超 500 亿元、投前约 3600 多亿元——数字有出入且未经证实。

结论. 未经证实,请当作被广泛报道的说法看——但它戳中人心,因为精神上是真的:数据与判断这类安静的人力活,也许比纯算力更关键。

那句话「一半核心研究员,在标数据」

这几天疯传的那句话:据实录,DeepSeek 创始人梁文锋称,可以认为公司一半的人——以及一半的核心研究员、最重要的人——都在标数据。他的理由是:现阶段解决 AI,靠的就是数据

这是个故意扎眼的说法。它和「模型越做越大、GPU 越堆越多」的主流叙事唱反调,把聚光灯打在一件毫不光鲜的事上:耐心地定义什么才算好答案,再把它教给模型。

真正的瓶颈是数据和品味,不只是算力

按实录的说法,当下的约束不是卡、也不是缺聪明人,而是高质量数据,以及判断什么是「好」的那种品味。再往后的瓶颈是时间:OpenAI、Anthropic 起步更早、资本更多、卡也更多,所以其思路是要克制取舍——先标成本低的数据,再持续打磨。

台上,人人都在讲智能涌现;台下,最稀缺的仍是人类的耐心——一行一行把脏数据擦干净。

路线图AGI 像爬楼梯:思维链 → Agent → 持续学习

实录把通往 AGI 的路比作爬楼梯。去年的台阶是思维链——模型一步步推理。今年的台阶是 Agent——会动手行动的模型。再上一级是*持续学习*:在干活中不断学习的能力。

他的说法是:今天的 AI 不缺品味和直觉,缺的是持续学习。你得每次把所有上下文都喂给它,这几乎不可能。这也是他认为 AI 目前还不能简单替代员工的原因。

哲学克制、开源,与「合理利润」

克制一种战略——舍弃一些,换更重要的东西
开源一种让利:员工成就感、公司凝聚力、社区受益
野心不想做下一个超级 App/字节/腾讯
定价只赚合理利润——约等于买设备、十个月回本的利润水平
工作方式被安排的活儿 ≤ 一半时间,另一半自由探索

背景一份很贵的安静

这场交流会与 DeepSeek 的首轮外部融资有关——据称募资超 500 亿元人民币(约 70 亿美元),投前估值约 3600 多亿元(很粗略地说约 500 亿美元量级)。各报道数字有出入,别抓太死。

为何重要算力抢头条,数据也许决定胜负

哪怕你对这份录音保持健康怀疑,它能引发共鸣仍有其真实原因。在每一条「智能涌现」的头条背后,都压着一层并不光鲜、却极其人性的工作:决定什么是好答案,并清洗那些用来教它的数据。算力抢走了目光——数据和品味,也许在悄悄决定谁赢。