ANTHROPIC的 PM × Research 协作观察

全文约 11,000 字,阅读时间约 20 min    ·    BY:恬恬&小云&ClaudeCoworke&Codex    ·    北京 2026.05

Anthropic

【引言】过去 14 个月,Anthropic 的 ARR 从 $1B 涨到 $30B+、26 年以来高频连续发布了几十个产品功能。但最近我们发现,按PM负责人访谈里的说法,原来全公司 PM 只有几十人,且几乎不靠 PRD 推进。好奇,他们的产品到底是怎么的「长」出来的?(图为七位联创)

研究方法:信息基于公开信息、Anthropic 官方博客、高管公开各渠道的发言(Lenny's Podcast、Dwarkesh 等)、官方招聘 JD 和权威媒体报道整理。所有引用标注来源编号,完整列表见参考资料。Claude Coworke & Codex 主要贡献为资料收集、制图、coding和审稿并给出修改意见。

PART 01: 团队组织演化主线

Anthropic 从 50 人长到 5,300 人,组织发展大致经历了 5 个阶段。我们重点关注其中的一条线:现在的PM × Research 是如何从一个岗位试点,变成公司层面的组织安排的。

5,300
员工规模 · 2026 H1
Anthropic Labs 公告
>$30B
ARR · 2026.04
Sacra · Anthropic 官方
$380B
Series G 投后估值
2026.02
多家媒体
~80%
人才留存率
(行业较高水平)
据访谈口述 · 未独立核实

1.1 五个阶段一图速览

五阶段时间轴
阶段一 2021–2022 open ai出走后的创立期 ~50 人 PBC + LTBT + RSP 阶段二 2023–2024 外部高管首次注入新能力 ~500 人 Mike Krieger + Catherine Wu 新产品人才的加入 阶段三 · 拐点 2025 组织和业务规模化 ~2,300 人 PM × Research 工作模式公开 阶段四 2026 H1 组织成型,labs的新探索 ~5,300 人 Labs 公司化 · Ami Vora 任 CPO 阶段五(展望) 2026 H2 → IPO + 全球化 东京 · 班加罗尔 · 首尔 · 悉尼 PM × Research 的职能演变,发生在阶段三 → 四
补充说明:下面只展开和 PM × Research 直接相关的时间节点。七位联创、高管背景、PBC / LTBT / RSP 治理结构,以及早期职能四大支柱,统一放在参考资料 A。

1.2 PM × Research 工作模式是怎么演变出来的

下面这条时间线只列五个和 PM × Research 直接相关的节点。Mike Krieger(前 Instagram 联合创始人、Artifact 创始人)2024.05 加入 Anthropic 任 CPO;三个月后,Catherine Wu(前 Princeton CS、Scale AI、Dagster、Index Ventures合伙人)加入,成为首位 Research PM。从 Mike 到任算起,这套分工大约用了 20 个月,从内部试点探索、变成公司层面的组织设计方式。[2] · Observer · 2026.04

2021 → 2026 · PM × Research 主线 2021 - 2024.04 没有专门的 PM 研究员 + 工程师 + 创始人 七位联创自己负责所有非研究的事,产品由研究员和工程师推动。 2024.05.15 · 起点 Mike Krieger 加入,任 CPO 第一位真正意义上的产品团队搭建者 前 Instagram 产品负责人、联合创始人 / Artifact 创始人。 上任后,开始重组产品团队 2024.08 第一位 Research PM:Catherine Wu 加入 把"PM 进研究团队"做成具体岗位 前 Princeton CS · Scale AI · Dagster · Index Ventures合伙人。 自己写 evals、自己搭 RL 环境——这类能力后来进入 Research PM 的招聘标准。 拐点:2024.05 上任 → 2025.06 公开化(约 13 个月) 从内部组织调整 → Lenny's Podcjast 第一次系统对外讲他们的探索 2025.06.05 Mike Krieger 在 Lenny's Podcast 公开方法论 Mike的态度仍是"倾向"这样分工 第一次对外讲清 PM 嵌入研究的方法。 2026.01.13 · 战略落定 Labs 公司化 · Mike Krieger 离任 CPO 转 Labs PM × Research协作模式被独立编制承载 Mike Krieger 以技术成员身份加入 Labs,与 Benjamin Mann 联合负责,向 Daniela 汇报。Ami Vora 接任 CPO。 2026.03 Catherine Wu 公开发表 在 Claude 官方博客《Product management on the AI exponential》 继续对外解释 PM × Research 的做法。致辞从 Mike Krieger 上任算起,整个演化用时约 20 个月。

1.3 当前组织架构与展望

下面是 Anthropic 2026 上半年的组织结构(阶段四"双轨成型"),以及阶段五 IPO 与全球化的展望。

Dario Amodei CEO · 联合创始人 Daniela Amodei President · 联合创始人 研究 RESEARCH Jared Kaplan CSO 首席科学官 对齐科学 Jan Leike 可解释性 Chris Olah 产品 PRODUCT Ami Vora CPO(2026.01 任) Claude Code Catherine Wu (Head) Cowork Catherine Wu (Head) 工程 ENGINEERING Rahul Patil CTO(2025.10 任 · 前 Stripe CTO) Core Resources Tom Brown · 算力底座 架构 ARCHITECTURE Sam McCandlish 首席架构师 + RSO 政策 POLICY Jack Clark Head of Policy 前沿红队 Logan Graham · ~15 人 LABS Mike Krieger + Benjamin Mann 联合负责(向 President 汇报) Mythos · Glasswing 前沿能力 · 受限发布 实线 = 正式汇报到 CEO 链路;橙色虚线 = Labs 直接向 President 汇报;红色框 = 政策 / 红队,独立成线对外公开。 六根立柱并列:研究、产品、工程、架构、政策、Labs——后两根让 Anthropic 和普通 AI 公司拉开差异。 两个特殊设计:第一,政策 / 红队独立成线,不归 CTO 管;第二,Labs 不在 CPO 体系下,由 Mike Krieger 和 Benjamin Mann 联合负责,相当于内部的二号公司。

展望 · 阶段五 · IPO 与全球化(2026 H2)

$850–900B(一级市场最新意向估值 · 2026.04) ≤ $630B(潜在 IPO 估值上限 · eWeek 2026.01) 潜在 IPO · 最早 2026.10

根据2026.04 TechCrunch 报道,Anthropic 收到多个意向,可能再融 $50B、估值 $850–900B[31];eWeek 同期也报道,潜在 IPO 估值上限约 $630B[32]。虽然两个数字均为媒体报道且口径不同:前者是一级市场意向,后者是公开市场预估,但发展势头由此可以见一斑。

按照目前的规划,如果东京、班加罗尔、首尔、悉尼等地招聘顺利开展、全球化继续推进。在新的阶段,也许会遇到新的问题:比如IPO 之后的利润压力,会不会削弱"使命驱动"?组织出海之后,这样的用人方式和企业文化还能不能保持一致?

PART 02: PM × Research 和行业做法的区别

大多数 AI 公司里,PM 和 Research 各管一摊:研究负责把模型变强,产品负责在 API 外面做体验。Anthropic在AI行业摸索的过程中,选择把两种职能逐渐融合在一起。

2.1 串行瀑布流:行业默认

大多数 AI 公司里,研究团队和产品团队是分开的。研究关心模型有没有变强、能不能发论文;产品关心模型在生产环境里好不好用、能不能留住用户。两边的考核指标不一样,工作环境也不一样。[11][12]

研究团队

指标看模型准确率、论文数量、技术新颖性

问的是"能不能做出更强的模型"

实验环境独立,离用户很远

产品团队

指标看用户量、稳定性、收入

问的是"这东西在生产环境跑得动吗"

等研究交付 API,在外面搭一层 UX

这种分工带来一个后果:研究和产品之间的工作必须排成一条流水线。研究做完模型,工程包成 API,产品在 API 之上做界面,发布给用户,用户反馈再写成报告递回研究手里。整条链路下来,反馈传到研究通常已经是几个月以后。Thoughtworks 在 ML 工程报告研究中提出:当一个项目要跨多个团队串行协调时,总耗时会比单团队完成长 10 到 12 倍。[13]

两种工作流程对比 · 串行瀑布流 vs. Anthropic 闭环
A · 串行瀑布流(行业常见做法) 总耗时:6-12 个月|反馈回到研究:3-6 个月 第 1 阶段 研究做模型 关心论文与基准分 不接触生产约束 交付物:模型权重 第 2 阶段 工程包 API 关心稳定性与吞吐 把模型变成接口 交付物:服务化 API 第 3 阶段 产品搭 UX 在 API 之上做界面 PRD 文档驱动 交付物:可发布版本 第 4 阶段 用户反馈 收集到客服、调研 写成总结报告 交付物:反馈文档 反馈传回研究:3-6 个月后 墙 墙 墙 B · Anthropic 的闭环工作方式 总耗时:1 天 - 1 周|反馈回到研究:约 10 分钟 研究 + PM + 设计 + 安全 同处一室 研究 PM 设计 安全 工程 研究 用同一份 evals 看模型表现,一起决定下一步训什么 没有 PRD,没有交接文档,没有协调会 真实用户 Claude Code、API、claude.ai 1,000+ 内部 dogfooding Claude 反馈管道 自动 enrich / cluster ~10 分钟一条结构化 用 Research Preview 实时记录 结构化反馈直接进入下一轮训练优先级
A(上面) 是大多数 AI 公司的做法:研究→工程→产品→反馈一段段排开,中间隔着无形的墙。B(下面) 是 Anthropic 的做法:所有人在同一个房间里,靠 evals 对话,靠 Research Preview 把功能先发出去试,反馈在十分钟级别回到训练优先级里。

2.2 让 PM 嵌入 Research 是怎么实现的

两条腿走路的内部实验

2025年,Anthropic的CPO Mike Krieger 与 OpenAI 的CPO Kevin Weil 同台对谈。当时Mike提到 Anthropic 内部在做一个小实验:把一部分 PM 同学,嵌入模型 Research 团队,和研究员一起改进模型本身;另一部分 PM 同学保持在原产品 / UX 团队,优化交互体验。实验发现,几乎所有的高价值的创造,都来自前一种协作模式。

一年后,从倾向变成了强推

Mike Krieger 后来回看这件事时说:"25 年 Summit 对谈,那时候我其实没那么确定,现在我非常确定。"这个坚定态度的转折点,他说来自对产品经理工作价值的判定标准,清楚了:

"这个产品,任何人拿现成 API 都能搭出来吗?"如果答案是"能",Anthropic 就没必要自己做。真正值得它投入的,是处在"模型能力 × 产品形态"交叉点上的产品:这种产品必须从 post-training 阶段就开始介入,不能等模型训完了再"套 UI"。

Anthropic 的实践:把所有人放进同一个房间

Mike Krieger 回想,自己出任 CPO 之后做的最重要的决定:"是把几乎所有产品资源都从:在公开 API 之上搭 UX,转向产品和研究团队坐在一起做事",他现在认为这种嵌入式协作能带来 10 倍的影响。[3]

具体做法主要有五个。

Anthropic 的五项做法(全貌)
研究 + 产品 不再需要等和开会沟通协调 机制 01 PM 进研究团队 PM 就坐在研究旁边 参与训练决策 机制 02 Evals 作为通用语言 10 个高质量 evals 替代用户 anecdote 机制 03 Research PM 角色 模型和用户沟通的中间人 Research PM可以自建 RL 环境 机制 04 反馈闭环 Claude 自建管道实时聚类 ~10 分钟一条反馈 机制 05 Research Preview 先发出去再说 零声誉损失
五项做法围绕同一个目标:减少研究和产品之间的专门沟通和协调环节。逐项展开见 Part 3。

2.3 两种做法的对比

维度串行瀑布流Anthropic 的做法
研究和产品的关系分两个团队,按阶段交接PM 直接进研究团队,一起决定训什么
用什么语言沟通产品讲用户故事,研究讲技术指标Evals:双方看同一份测试结果
有没有专门的中间人没有,靠 PRD 和会议Research PM,懂研究也懂产品
反馈多久回到研究3 到 6 个月大约 10 分钟一条
试错的成本高,要走完整个发布流程低,Research Preview 当天可上线
功能性工作单元产品交付研究-产品的双向回路
人才留存差异较大约 80%,行业较高水平

Anthropic 没把重点放在优化流程上,它更关心怎么减少需要交接的地方。五项做法单独看都不夸张,放在一起,"协调"这件事就少了很多。

2.4 PM 嵌入 Research,实际嵌入的是两层

"PM 嵌入 Research"这句话容易被误解成:PM 直接参与模型架构、训练算法或研究路线。更准确地说,PM 进入的是模型能力形成过程中的两个相邻层:Harness 脚手架层和 Model Behavior 模型层。(这不是 Anthropic 官方组织图里的层级,是尝试理解 PM × Research 模式的分析切面。)

层级它回答的问题PM 和 Research 一起处理什么
UX 层用户看到什么、怎么用入口、界面、交互、工作流呈现
Harness 脚手架层模型如何在场景里工作工具、运行、记忆、状态、任务拆解、Evals、反馈闭环
Model Behavior 层模型应该形成什么稳定行为确认边界、不确定性表达、错误恢复、遵守规范、避免 reward hacking

Harness 层是 PM 最直接的主战场。以 Claude Code / Cowork 这类产品为例,问题不只是"做一个开发者工具"或"做一个桌面助手",而是要定义模型能访问哪些文件和工具、如何读取上下文、如何规划多步任务、如何运行测试或检查结果、如何判断任务完成,以及失败后如何继续。这些都不是传统意义上的 UI,而是把一个真实职业工作场景装进模型运行时的一套系统。

Model Behavior 层则是从这些场景里反推出来的。代码编写、桌面代理和企业工作流实际情况下,都会暴露一批模型行为问题:比如模型是否先读上下文再行动,是否在高风险操作前请求确认,失败后能否恢复或解释,是否能区分"我知道"和"我猜测"等。这些问题表面上是产品体验,实际上会进入 Evals、tool-use 策略和 post-training 讨论。

Research PM 的价值,不是把用户需求翻译成 PRD,而是把真实工作场景翻译成模型可运行、可评估、可训练的系统。先在 Harness 脚手架层定义工作环境,再通过 Evals 和用户反馈,把行为缺口推回 Model Behavior 层,这才是"产品和研究坐在一起"真正产生杠杆的地方。

PART 03: PM × Research 运作的真实实践

Part 2 我们对比了两种路线,也补了一层 Harness / Model Behavior 的解释框架。Part 3 落回到 Anthropic 内部,看它实际是怎么运转的:把五项机制逐条拆解、用Artifacts 和 Memory 两个案例、PM 和研究员意见冲突时谁拍板等实际情况,探索什么样的 PM 才能发挥出超高价值。

3.1 五项机制逐项展开

经过Mike Krieger入职后的调整,产品团队不再只等模型 API 交付,而是开始更早进入研究和 post-training 环节。[3] 与此同时 Mike Krieger 保留了 Anthropic 的 bottoms-up 文化:比如Artifacts 和 MCP 都不是 PM 立项的推动的,而是研究员和工程师自下而上推出来的。

机制一 · PM 直接进研究团队

机制一讨论的是 Research PM 的位置变化:PM 从研究链路外部,进入训练决策现场。[3]

Mike认为,真正能拉开差距的产品,往往来自对模型能力的深度参与,PM 必须在训练阶段就在场。Anthropic 内部有一个具体角色承接这件事:Research PM。Catherine Wu(2024 年 8 月加入,首位 Research PM,前 Princeton CS、Scale AI、Dagster、Index Ventures)是这个角色的样板。她自己搭过 RL 训练环境,这在传统公司里通常不属于 PM 的工作。她解释过:当你需要和研究员讨论"这个能力该训进去吗""需要多少数据",如果没亲自跑过训练,就只能靠转述。[5]

机制二 · Evals 作为协议(不只是测试集)

大多数公司里 Evals 是 QA 的工作。Anthropic 把它变成 PM 和研究员之间的沟通协议。Catherine Wu说:"Evals是被严重低估的,每个 PM 和工程师都应该会写。"[6]

他们的做法是:当一个产品方向不确定时,PM 先写 5 到 10 个 Evals 跑一遍,"通过/失败"的具体结果,作为整个团队讨论的起点。

Anthropic 内部的 Evals 分三类:

  • 端到端——在 SWE-bench 上发现回归
  • 触发式——判断这次查询是否应该触发联网搜索
  • 能力——数据科学、重构等任务,有标准答案

Evals 把 PRD 里那些"这个功能应该满足……"的需求,改写成机器可以执行的判断。产品和研究团队的冲突解决也因此有了抓手:研究员可以看着失败案例直接说"这个我能加进训练",或者"这个超出能力范围"。为此,公司专门设了高薪岗位在维护这套Evals基础设施:TPM Model Evaluations($290K-$365K)、EM Agent Prompts & Evals($320K-$405K)。

机制三 · Research PM 这个岗位角色人才要求很高

Catherine Wu 描述 Anthropic 的 Research PM岗位说:"要连接研究团队和真实客户,收集模型反馈,跑 evals,找到可信的基准,推动模型发布。"[5] 这里的 Research PM 既不像传统 PM(不写 PRD),也不像研究员(不发论文),但两边都得懂。

他们认为,当需要和研究员讨论"这个能力该训进去吗""需要多少数据"时,如果PM没亲自搭 RL 环境、跑 evals、看 trace、跑训练,他就只能靠描述。这样做不是要抢研究员的活,是为了坐到训练决策桌边时,能说出有分量的观点。

机制四 · 反馈跑得非常快

Anthropic 设了 Product Operations Manager, Feedback Loops 这个专门角色,负责把全公司各种产品(API、claude.ai、Claude Code)的用户反馈接入统一系统。[6]

  • Claude 自己驱动管道,自动会加标签、归类、聚合
  • 1,000 多名员工自愿加入 Claude Code 反馈频道
  • 平均每 10 分钟就有一条新反馈提交
  • 团队明确在所有场合、向所有人说:"我们喜欢负面反馈"

且反馈最后会逐渐变成训练优先级里的具体条目,而不会躺在季度总结报告里。

机制五 · Research Preview 试错

Anthropic 几乎所有功能首先都以"Research Preview"的身份发布——告诉用户"这是我们正在试的东西,可能会改、可能会下线,不保证长期支持。"[4][6]

这个标签,给团队留了一条低成本试错通道:

  • 功能不需要做到完美才能见用户
  • 效果好继续做,效果差悄悄下线,团队不会因此丢面子
  • 研究团队的工作能很快接触真实用户场景,省掉了漫长的产品反复讨论的流程

3.2 新协作机制运行的实际案例

拆开两个案例看看"研究和产品坐到一起"的真实情况。

案例一

Artifacts × Claude Code Skills 配对

Artifacts 是 Claude 在对话中直接生成并展示富交互内容(网页、SVG 图表、交互式组件、代码演示等)的功能。2024 年由研究员和工程师一起,自下而上推动发布,后来成为 Anthropic 最成功的产品之一。[3]

协作方式是:研究侧的 Claude Code Skills 小组(专门做 post-training,教 Claude 掌握特定技能)和产品团队配对,两边坐在一起干活。Skills 小组在 post-training 阶段做定向微调,让模型学会判断哪些内容适合用 Artifacts 呈现、生成更复杂的交互式组件,并在用户修改需求时维持内容一致性。产品团队同步提供使用数据和用户反馈,告诉 Skills 小组哪些场景需求最大、哪些交互模式用户最买账。两边没有prd和开会环节,就在同一轮训练周期里迭代。

差别在于:

老路

"我们用了模型,加了点 prompt"

产品团队拿现成 API,靠 prompt 调出想要的行为

新路

在 fine-tuning 流程里就把产品意图编码进去

产品形态和模型能力一起塑造

"光靠 prompt 早就不够了。我们必须进入 fine-tuning 的流程内部。"

— Mike Krieger[3]
案例二

Memory 评审会的小场景

Mike Krieger 在访谈中讲了一个产品评审会时发生的对话,透露出协作日常的真实状态:

产品评审会 · 内部
Mike Krieger(CPO) 如果我们要做 memory 功能,应该去和研究员聊。
产品团队 我们已经聊了好几周了。Claude 刚 ship 的那一批 memory 能力,就是这么来的。
Mike Krieger(当下反应) 好的好的,感觉对了,现在做的事情是对的(笑)。
这个细节说明了三件事:
  • PM 主动找研究员是默认动作。
  • 研究侧的 capability roadmap 和产品侧的 feature roadmap 是同步对齐的。
  • Mike Krieger 衡量是否是"健康协作"的信号是:当我刚意识到要找研究员时,团队已经在沟通了。

来源:[3]

3.3 当 PM 和研究员意见不一致,谁说了算

这是"PM 嵌入研究"最容易出问题的地方。Anthropic 主要靠公开化来处理冲突,再用三个机制收束:

机制一 · Slack 公开辩论

有任何分歧直接在频道里吵,包括跟CEO吵。 Dario Amodei 和很多员工都有自己的公开Slack频道,分享产品思考、心得等等。Amol Avasare(增长负责人)说:"人们就直接在 Slack 上跟 Dario Amodei 争论,他也回。"[8][21]

机制二 · 用 Evals 数据决定

当一方说"这个能力模型做不到"、另一方说"不行、客户必须要",那就先去跑 Eval:

  • 分数离目标 80% 以上 → PM 这边赢,做 prompt engineering 补差距
  • 分数只有 10% → 研究员这边赢,等下一代模型

机制三 · 训练决策被当成产品决策

算力分配、post-training 选什么数据、要不要做客户专属模型,这些以前通常是研究负责人拍板的事。在 Anthropic,它们是产品和研究共同决策。PM 不只是提需求的人,也是这个决策圈的成员。

3.4 Anthropic PM 长什么样?

Mike 说:"这是一种新的工作方式,不是所有 PM 都能掌握。"[3] 他说自己在产品评审时,能很快看出哪些 PM"对路"与否。下面分三块看:PM 画像、招聘信号、时间精力的分配。

"做得好" vs "不对路"的 PM 画像

✅ "做得好"的 PM(Mike Krieger 说的硬指标)

知道研究在做什么——能脱口说出本季度 post-training 在加哪些技能

介入时机更早——在能力 spec 阶段就提产品需求,而不是等模型 release

反馈能回到训练——把产品里收集到的失败案例形成 eval / 数据,流回训练

研究和工程的正反馈——研究员愿意继续和这个 PM 对话

⚠️ "不对路"的 PM(隐含画像)

把模型当黑盒——只在 release 后才讨论 UX

提的功能 prompt 就能解决——其实没有用到模型本身的特殊行为

不知道下一代能力路线——做的产品在下一次模型升级后立刻被淘汰

研究员逐渐回避对话——开会时被绕开

一个 Research PM 的一周

基于 Catherine Wu 在 Lenny's Podcast 上的描述(2026.04) Catherine Wu Research PM 一周 写代码(Claude Code) 30% 原型 · Evals 脚本 · 数据分析 · RL 环境 跑 Evals + 推模型边界 30% 故意把模型推到极限,建立 model taste 研究讨论 + 训练决策 25% 算力分配 · Post-training 优先级 协调、文档、Cowork 处理 15% 邮件 · Slides · Slack · 差旅
和传统 的 PM 比,这是一个很不一样的精力分配时间结构。传统 PM 大约 50-60% 时间花在协调、会议、写文档上,真正接触模型本身的时间不到 10%。Research PM 则有约 60% 时间直接和模型打交道。

招聘的三个筛选信号

Catherine Wu 说过一句被到处引用的话:"我们宁愿招一个有产品品味的工程师,也不愿意再招一个 PM。"[6] 这个意思具体落到 Anthropic 招 Research PM 的标准上:

01
能写代码
不要求工程师水平,但必须能用 Claude Code 自己搭原型、写 Evals、跑数据分析。
02
对模型有感觉(model taste)
面试里看:拿一个具体的模型问题让候选人讨论,看他能不能区分"这是 prompt 问题、context 问题、是模型选错了,还是能力差距"。如果是能力差距,是 80% 能力到位还是 10%。
03
能吵架
Slack 公开辩论文化对应的就是这个。一个习惯回避冲突、什么都说"都对都对"的 PM,进了研究团队会很快缘化。

另一个现象也很有意思:Anthropic 内部 PM 数量比同等规模公司少一半以上。Catherine Wu 说他们有一个"两周规则":少于两周能做完的项目,不需要 PM 参与。且更大的项目反而要配更多 PM,而不是更少。 当写代码成本接近零的时代,真正稀缺的变成了"决定写什么",PM 就应该把精力放在判断上。

PART 04: 延伸思考,可能遇到的风险

前面三部分拆解了 Anthropic 的产品和研究团队协作机制。下面我们斗胆尝试:推演一下这种工作方式在规模化之后,可能会在哪里出问题。(说明:信息来源公开报道等引用。)

访谈里 Mike Krieger、Catherine Wu、Dario Amodei 给出了很多"我们做对了什么"的分享。但这套做法本身是有隐形的代价、规模化之后的风险,以及还没解决的张力,这些在公开材料里很少有人展开讲。

4.1 高度绑定一类特殊员工

招聘成本大大大增加。整个 PM × Research 协作机制对人的要求非常高:要会写代码、要有 model taste、要敢在 Slack 跟 CEO 吵架、要自己搭 RL 环境。类似Catherine Wu 是这种画像的代表,但她的简历不是常态。多年工程师 + 产品 + 短期 VC 经历,刚好踩在三个圈子的交集。

问题是:当公司从 5,300 人再涨到 1 万、2 万人,能持续招到 50 个 Catherine Wu吗?如果招不到,要么降低标准让普通 PM 进来(机制会被稀释),要么保持标准但接受 PM 数量跟不上业务速度。近期大张旗鼓出来宣传他们的PM模式,是否也侧面说明招聘遇到了困难呢?

4.2 Slack 公开辩论文化,在更大规模下可能会退化

"员工直接和 Dario Amodei 在 Slack 上争论"这种文化,在 50 人、500 人甚至 2,500 人时是健康的。但当公司到了 10,000 人之后,可能出现两种退化:

  • 少数 loud voice 在频道里高频发言,普通员工反而更不敢说话,公开辩论变成"几个人的话语权竞赛"
  • 讨论被信息过载淹没,重要的分歧被埋在频道的历史里,决策和重要讨论变慢、变小了

这两种退化在 GitHub、Stripe 等公司都发生过,他们也都曾以 Slack 公开辩论文化著称。Anthropic 还没到那个临界点,但风险已经能看见。

4.3 Labs 内部公司化是否说明主组织开始变重了

2026 年 1 月 Labs 公司化时,Mike Krieger 离任 CPO,以技术成员身份加入 Labs,由他和 Benjamin Mann 联合负责,直接向 Daniela 汇报。官方解释是"让最快试错的工作脱离正常产品节奏"。

但反过来读:如果主产品组织还能像 2024 年那样轻盈试错,为什么还需要 Labs 这个特殊编制?Labs 的存在,某种程度上也说明主组织开始变重。这套打法本身没问题,但规模带来的官僚化是任何组织都会遇到的事。Labs 是 Anthropic 给自己留的一道防线,还不能算最终解。

写在最后

读到这里你大概也发现了:"PM 嵌入研究团队"不是成功的唯一主要原因,更像是一连串条件共同支撑下的结果。它依赖很多基础:自研的 SOTA 模型、"Evals 优先"的沟通文化、把训练决策当产品决策的共识、Slack 公开辩论、写代码成本接近零等等。少一样,PM 跟研究员坐得再近,可能也聊不到一块去。Anthropic 的组织内部协作和运转发展到今天,会不会是不是未来 AI 产品组织的主流形态呢,还是要交给时间和市场去持续回答。

参考资料

参考资料 A · 公司基本信息

以下内容补充七位联创背景、PBC / LTBT / RSP 治理结构、初始四大支柱。对研究 PM × Research 协作模式而言,这些是"为什么要这样设计组织"的底牌。

A.1 七位联创:从 OpenAI 出走

2020 年,OpenAI 的核心安全团队集体出走。Sam McCandlish 在七位创始人座谈会上回忆:"我们中没有谁一开始就想创业,只是觉得这是一份责任。"[1]

两个决定奠定了 Anthropic 后来的组织选择:七位联创同股同权(外界曾警告"七个创始人一定会内斗",Dario Amodei 后来说这反而成了公司力量的来源);七人共同承诺把个人财富的 80% 捐给慈善。[1][2]

姓名当前角色来历在 Anthropic 干什么
Dario AmodeiCEO普林斯顿计算生物物理博士;前 OpenAI 研究 VP,主导 GPT-2/GPT-3整体战略;与 Daniela 形成"研究 / 运营"双核
Daniela AmodeiPresident前 OpenAI VP of Safety & Policy;前 Stripe 早期员工管运营、人事、安全政策、合规;Labs 直接向她汇报
Jared KaplanChief Science Officer理论物理学家;与 Sam、Dario Amodei 合写"Scaling Laws"论文主导 Constitutional AI——Claude 行为准则的底层方法
Sam McCandlish首席架构师 / RSO斯坦福理论物理博士;前 OpenAI Research Lead2025.10 前任 CTO,现专注预训练 + 执行 RSP
Tom BrownCore Resources 负责人MIT 工程硕士;GPT-3 论文第一作者管 Claude 训练所需的全部算力基础设施
Jack ClarkHead of Policy前 Bloomberg / The Register 记者;前 OpenAI Policy Director对外政策、安全发现公开、监管沟通
Chris Olah可解释性研究负责人未读完大学;前 Google Brain;机制可解释性方向开创者从电路层面理解模型在做什么

A.2 治理结构:PBC + LTBT + RSP

PBC(公益性公司)不是标签,是法律强制约束——短期利润最大化从来不是合法选项。董事会有法定义务平衡股东利益与公共利益。LTBT(长期利益信托)作为独立监督层,确保公司忠实于公共使命,独立于任何单一股东或董事会成员。两层结构形成的效果:哪怕未来 IPO、引入大量机构股东,"使命驱动"也不会被稀释。

Tom Brown 把RSP(负责任扩展政策)比作 Anthropic 的"宪法"——在模型能力达到特定阈值时必须满足相应的安全条件才能继续扩展,是所有重大决策的指导框架。[1]

A.3 初始四大支柱(2021)

公司在成立早期确立四个职能领域。此时的"产品"几乎等同于"使 Claude 能够被使用",没有独立的 PM 团队——这是后面 Catherine Wu / Mike Krieger 改造的起点。

研究 RESEARCH
可解释性 · 对齐 · RLHF · Scaling Laws
政策 POLICY
安全沟通 · 前沿红队 · 监管对接
产品 PRODUCT
Claude 初版 · 极小团队 · 无独立 PM
运营 OPERATIONS
人力 · 财务 · 法务

A.4 关键人物时间线(按阶段)

时间对应阶段人物角色·变化背景
2021创立期七位联创覆盖全部关键角色OpenAI 核心安全团队集体出走
2021创立期Benjamin Mann早期成员 / Labs 创始人GPT-3 论文共同作者
2023早中期Krishna Rao第一位外部高管 · CFO前 Airbnb 财务负责人
2024.05早中期Mike Krieger加入任 CPOInstagram 联合创始人 / Artifact 创始人
2024.08早中期Catherine Wu第一位 Research PM前 Princeton CS · Scale AI · Dagster
2024早中期Jan Leike加入 · 对齐科学前 OpenAI 超级对齐联合负责人
2025规模化Mike Krieger把 PM×Research 从试点推为战略Lenny's Podcast 首次公开方法论
2025.09规模化Vitaly GudanetsCISO前 Netflix 安全负责人
2025.10规模化Rahul PatilCTO前 Stripe CTO
2025规模化Ami Vora产品负责人前 Facebook / WhatsApp 产品 VP
2025规模化Amol Avasare增长负责人冷邮件联系 Mike Krieger 加入
2026.01双轨成型Mike Krieger离任 CPO → 技术成员加入 Labs与 Benjamin Mann 联合负责 · 向 Daniela 汇报
2026.01双轨成型Ami Vora接任 CPO核心产品进入全球扩展模式
2026 H2展望—IPO + 全球化东京 · 班加罗尔 · 首尔 · 悉尼

参考资料 B · Anthropic 相关 · 资料来源([1]-[10]、[31]-[32])

#来源URL
[1]七位联创座谈会"Building Anthropic"coinlive.com
[2]Observer — The 14 Executives Now Driving Anthropic's Future (2026.04)observer.com
[3]Mike Krieger — Lenny's Podcast Ep.268 (2025.06)lennysnewsletter.com
[4]Benjamin Mann — Lenny's Podcast Ep.279 (2025.07)lennysnewsletter.com
[5]Catherine Wu — Product management on the AI exponential (2026.03)claude.com
[6]Catherine Wu — Lenny's Podcast (2026.04)lennysnewsletter.com
[7]Scott White — Building With AI 播客 (2024.08)snipd.com
[8]Amol Avasare — Lenny's Podcast (2026.04)lennysnewsletter.com
[9]Anthropic 官方公告"Introducing Labs"(2026.01)anthropic.com
[10]Dario Amodei — Dwarkesh / Fortune (2026.02)fortune.com
[31]TechCrunch — Anthropic could raise $50B at $900B valuation (2026.04.29)techcrunch.com
[32]NZ Herald — Kiwi Chris Liddell recruited ahead of Anthropic's $630B IPO (2026.01)nzherald.co.nz

参考资料 C · ByteDance / OpenAI / DeepMind / 行业相关([11]-[30])

#来源URL
[11]Why Complete Separation Fails in AI — FourWeekMBAfourweekmba.com
[12]Nalvin — The Future of Product is Integratednalvin.com
[13]Thoughtworks — Effective machine learningthoughtworks.com
[14]MIT Technology Review — The two people shaping OpenAI's research (2025.07)technologyreview.com
[15]WebProNews — OpenAI's Code Red (2025.12)webpronews.com
[16]Superalignment 团队解散(多家综合报道,2024.05)chinastarmarket.cn
[17]Calvin French-Owen — 7 周一款新产品,OpenAI 到底有多卷baai.ac.cn
[18]InfoQ — 没有 KPI,也能领先 OpenAI?infoq.cn
[19]IT之家 — 谷歌大脑 DeepMind"婚后"貌合神离ithome.com
[20]Beyond Model Power — Redefining AI Competition (2026.04)phys.sabanciuniv.edu
[21]Business Insider — People 'just argue with Dario' on Slack (2026.04)businessinsider.com
[22]Ken Priore — The move that made AI safety a competitive weaponkenpriore.com
[23]ByteDance Seed 官网(团队介绍 / 招聘 / 研究方向)seed.ByteDance.com
[24]腾讯新闻 — 字节 Seed 架构再调整,朱文佳汇报线下调,转向吴永辉汇报 (2025.10)news.qq.com
[25]知乎独家 — 字节 AI Lab 将全部并入 Seedzhuanlan.zhihu.com
[26]字节跳动校园招聘 — Top Seed 大模型顶尖人才计划 JDjobs.ByteDance.com
[27]JoinByteDance — Research Scientist in Foundation Model (Seed - LLM - Model)joinByteDance.com
[28]华尔街见闻 — 吴永辉接管字节 Seed 这一年wallstreetcn.com
[29]chooseai — Flow、Stone…一文看懂字节的 AI 组织版图(2026.02)chooseai.net
[30]每经网 — 六大技术板块曝光,字节跳动 Seed 全球招募百名大模型人才 (2026.04)nbd.com.cn

共约 30+ 个独立信息来源。Anthropic 部分以 Lenny's Newsletter / 官方播客 / Claude Blog 为主;字节部分以官网 JD、腾讯新闻、华尔街见闻、知乎独家、晚点等中文权威媒体为主。截至 2026 年 4 月 30 日。欢迎针对研究内容展开探讨,邮箱:idadujuan@gmail.com。

READING DATA
20 人次阅读