W

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

Business Management
Share
中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

所有人都在尝试建立关于AI的判断,但所有共识都在迅速过期。
访谈 | 巴芮 海风
文 | 海风 刘思洁
编辑 | 刘思洁
封面图源 | 受访者拍摄
“野蛮生长的阶段已经过去了。”
这是身处硅谷AI创业一线的马培元最近最深的感受。
2021年12月,本科毕业后,他进入号称“美版知乎”的Quora,后来转到AI聊天机器人聚合平台Poe,担任资深AI工程师。2个月前,他又加入硅谷最热门的AI Agent创业公司之一Cognition。
2026年5月,这家成立不到三年的公司宣布完成超过10亿美元融资,估值升至260亿美元。8个月前,它的估值还是102亿美元。
除了工程师,马培元还有另一个身份——投资猎头(Venture Scout)。他替投资机构寻找值得下注的AI创业项目,每年拥有50万美元的投资额度。
毕业后的这四年多的时间里,他似乎始终行动得要比AI行业共识早,在“agent”这个词还没有被任何人讲清楚定义之前,他所在的团队已经悄悄立项。在Anthropic还是无名之辈时,他们就成了Claude最早的深度用户。他是团队里第一个AI认证工程师、第一个AI agent工程师,后来又把整个工程团队“洗脑”成了使用AI编程的AI Native团队。
这种认知和行动的超前,最有意思的印证发生在两周前,他在和“未来人类实验室”对谈时随口说出“people manager正在消亡”,没过多久就被腾讯、字节宣布取消中层的新闻坐实。
变化发生得太快,在硅谷,要时刻与变化共处。
在这篇稿子两次访谈的两周间隙里,马培元发现自己上一次讲的硅谷“追逐最贵最前沿模型”的逻辑,就开始站不住了。当下硅谷流行的做法是把多个便宜模型和顶尖模型“融合调度”使用。
和马培元聊了近5个小时,我们发现,他几乎一直在推翻昨天的自己,硅谷也一样。“我不能说所有的,但你可能说大于60%,一个月之后就可能又反着来了。”
过去几年,AI几乎改写了硅谷的所有默认规则:什么样的人更容易脱颖而出,什么样的组织更有竞争力,什么样的钱花得值。
当然,这些所谓“正确答案”的判断,也在迅速失效。 在AI领域,一年已经是很长的周期,很多判断可能在一个月内就被推翻。
以下,是马培元眼中十分当下的10个硅谷AI观察:
马培元
硅谷需要什么样的人才?
马培元的职业画像,高度契合了硅谷的AI公司最喜欢的人才样貌。他不是传统的计算机背景,没有得竞赛金牌,没有顶尖名校光环,甚至一度对计算机毫无兴趣,但过去四年,他从Quora的广告组一路做到Cognition的AI工程师,履历踩中了硅谷AI公司现在最想要的人才画像的每一个关键词。 他的经历,既是一部个人成长史,也是一份行业招聘标准变化的样本。
观察1:通才碾压专才
硅谷现在最抢手的人才画像,不是某个领域钻得最深的专家,而是 “每一项都过得去、没有明显短板”的人——业内管这个叫polyglot talent,更通俗的话说叫“六边形战士”。
2024年,Poe内部启动了一个当时还没人说得清定义的“agent”项目,组里挑中我这个新人的理由很直接:“既做过AI,也做过全栈开发和iOS”。当时组里其他人大多是传统机器学习、搜广推背景出身,他们的人不懂前端代码,而agent恰好需要能写前端界面。公司原本负责AI提示词工程的人离职后,团队里再没有人能补上这个缺口,那正好,反正我学得快,我既做这个agent提示词工程,也做这个它的前端写代码之类的。
这套“什么都会一点”的能力组合,后来变成了我找工作时最值钱的资本。我是你给我一个什么新的领域,我可以从两周之内学得差不多。而这正是早期创业公司要的人。
观察2:AI原生技能,可以在短时间内碾压资历年限
AI工具的使用能力,可以直接碾压传统意义上靠年限堆出来的资历。
我从Quora广告组转去iOS组的时候,理由是“想迈出舒适圈”,但此时我对iOS一窍不通,是彻头彻尾的“0年经验”。我当时没有选择慢慢补课,而是把GPT-4当成了自己的搭档。当时我周围的人都是非常资深的iOS工程师,他们可能不信AI。我iOS不会写,Swift代码不会写,于是我就疯狂地用AI帮我写代码。
结果是,我这个刚入行三四个月的新人,产出速度追平甚至超过了身边浸淫多年的资深工程师,两年内就做到了资深职位。这在传统晋升体系里,几乎是不可能的速度。 此前,在Facebook可能至少要4到6年,你才能变成资深工程师。谷歌有些人可能一辈子都不会升级到资深工程师。
我在Cognition就遇到过一位19岁的面试官。一开始我还有点沮丧,一个26岁的人被19岁的人“拷问”,很多问题我都答不上来。后来我意识到,这恰恰是一个迹象,说明这家公司确实能不拘⼀格降⼈才,且年龄不再是硅谷评判人才的标准。
观察3:招聘标准被彻底重写,AI公司不用同一套模板面试
我在Quora离职前,认真面了将近20家公司,算上打过电话的有30到40家。最多的时候,我一周被30多个猎头找上门来。
面试了这么多家公司,我发现,当下AI公司招人没有一个统一的面试模板。
但有几个很明显的变化,LeetCode式算法题的重要性在下降,关于AI系统设计的最佳答案每个月都在改变。
面试结构也在变化。在线笔试+work trial成了一种新的组合。work trial是一种非常短的“试用期面试”。有的3小时,有的5小时,最长也就一两天。我遇到的一次面试,就是直接给我一个代码库,让我用任何工具,包括AI,去解决一个实际问题。做完之后,还要展示思路和成果。整个过程已经非常接近真实工作。
更有意思的是,对AI使用的考察本身也被拆成两种模式。有些轮次要求必须用AI,看你怎么“by code”;但也有轮次明确禁止使用AI,比如debug,考的是在没有AI辅助加成下,你能不能找出错误,本质上是在测试个人实际的软件⼯程⽔平和品味如何。
面试本身也多种多样。比如,有的公司会让我做商业分析,判断他们应该收购哪个行业。
行为面试(behavior round)也变了。它不再是“个人最⼤的缺点和优点”“跟同事有冲突怎么解决”等传统问题,而是拉长时间线,去看一个人的成长轨迹,从高中到大学,从实习到工作,一路往下追,看你的“人生斜率”,判断你是不是⼀个能够指数型增⻓的⼈。
没有标准答案带来的一个意外好处是:没人能靠背题拿到offer。连我在Cognition的内推人都直接告诉我:“你别准备了,我觉得没什么可准备的。”
AI正在重构组织结构
在硅谷,最厉害的那批人,从来不属于某一家公司,只属于“那个时代最厉害的公司”。 二十年前是谷歌,十年前是Uber和Robinhood,五年前是Coinbase,现在是AI公司, 硅谷是“流水的银盘,铁打的兵” 。这批被新标准筛出来的人才,更会因使命感,而不是“待遇”留下。这些汇聚最厉害人的组织,也在AI的重塑下,发生着巨变。
观察4:对“AI原生”太过渴求
硅谷公司对AI原生(AI native)的渴求程度远远⼤于我的想象。我面试的公司大多是A轮、B轮,也有一些种子轮。一个很高频的问题是:你用什么AI工具?我通常直接把自己写的博客丢过去,对方基本上都会“目瞪口呆”。
他们会说,不只是想让我做AI应用开发,更希望我去推动公司内部的AI转型,让团队变得更AI原生。很多公司其实已经在做AI产品,但员工还没有建立自己的AI工作流。 而且,他们也很需要每天都刷很久推特、及时分享⼀些新奇AI发现或提效技巧的⼈。
这件事对我来说有点反直觉。我过去的一些“爱好”,比如每天折腾Claude Code等新工具、在Slack(一款办公软件)里分享AI用法,反而变成了一种新的组织角色。
之前在Quora时,我成功地让整个⼯程团队都⽤上了Claude Code。办公室每遇到⼀个⼯程师,我都会问,你有没有⽤AI来编程?我记得办公室⾥有一个做网络安全的工程师,一开始很抗拒,觉得用AI写代码风险太高。我后来让他换个思路,不写代码,只用AI读代码、理解代码库、做数据分析。后来,他也真的用起来了。
观察5:“更好地去使⽤AI”,实质是个组织转型问题
在Cognition做AI相关工作时,我越来越发现一个事实:更好地去使⽤AI,可能已经不是⼀个纯⼯程问题,而是⼀个组织架构上的转型问题。
举个例子。传统组织架构的互联网公司,一个Bug从发现到修复,往往要经过需求评估、工程排期、开发、测试、上线等好几个环节。真正用AI写代码可能只需要两三个小时,但整个流程走下来,经常要一个月。
以前这样的流程是合理的。因为修一个Bug,一个工程师可能要花三五天,流程的价值在于协调不同团队、分配资源。但AI把这个时间压缩了。
现在,我们用Cognition推出的Devin这样的AI软件工程师产品,两三个小时就能完成过去几天的工作。在Cognition,我们甚至可以用Devin找到负责这个Bug的人,再让Devin协助他完成修复,中间很多协调和流转环节都可以省掉,没有任何冗余。 其实是AI在倒逼整个组织架构的转型。
观察6:People manager正在消亡,管理者必须自己会写代码
所谓people manager就是⼯程经理(engineering manager)。在美国,近⼏年来流⾏的⼀个观点是,你作为管理者就要做好管理,更多负责团队协调、组织沟通,照顾员工情绪、提供成长支持,工程能⼒不用特别强。
但进到Cognition,我发现整个组织架构⾮常扁平化。比如,我直接汇报的对象甚至是CPO,也就是联合创始人之一。他不会细致关心你的个人成长,角色更像是确定大方向。甚⾄可以这么说,Cognition现在60多人的工程团队里,真正的people manager只有一个人,其他的包括CPO在内,都是“既管人、也写代码的”。这和我之前在Quora的体验完全不同。当时,一个manager可能要管五六个工程师。
Cognition团队集体穿上红衣服为一位日常爱穿红色衣服的同事庆生
我觉���这可能是AI带来的组织架构变化。 我观察到,任何⼀个朝⽓蓬勃的AI创业公司,其实都是这样,⼏乎没有只负责管⼈的经理——如果他管⼈,他⼀定技术也很强。
这个判断不仅仅发生在硅谷,在间隔两周的两次访谈之间,国内大厂腾讯、字节也先后宣布取消中层。
AI时代,任何判断都会很快被推翻
马培元观察到的变化,不只停留在组织层面。更宏观的行业判断:“在硅谷AI公司内部,什么样的Token支出算合理,什么样的模型才是好模型?”同样在以肉眼可见的速度被推翻。这一次,连他在第一次采访时说过的判断,都没能扛过两周。
硅谷的AI行业本身也在以月甚至以日为单位自我推翻,没有什么判断能保鲜太久。
观察7:Token Maxxing出现了分化,大公司开始重新关心效率
今年初,硅谷一度流行“Token-Maxxing”。Meta等公司一度甚至做过Token使用排行榜。谁用得最多,谁就是“AI原生”的代表。我觉得这⾸先就是一件很蠢的事情——AI token的使⽤量跟⼯程师的效率不能画等号。
Google、Meta的朋友还跟我说,他们当时都在搞“AI大跃进”。公司会专门办“AI Week”,所有人都要停下手里的工作,去写AI Skills,把自己的Skill包装得天花乱坠。
一开始,几乎所有公司都是这个思路:先让大家尽可能多地用AI,看看到底能用到什么程度。
但一旦变成公开排名,人的行为就会被扭曲。 工程师会为了“用得多”而用,甚至出现一些很荒诞的情况,比如让AI每晚定时乱跑、空跑一些没有意义的任务,只是为了增加使用量。这其实和用GPA去衡量学生能力一样,单一指标很容易失真。
后来很多高层也开始意识到这个问题。更具体的是,他们被账单吓到了。比如Uber,2026年全年的AI专项预算,前四个月基本就烧完了。很多大公司开始重新限制Token用量。董事会和CEO会开始问,这个token⽤量真的值吗?它真的能让我们提升这么多效率吗?⼀个亿美⾦花下去,它真的带来了⼀个亿的产出吗?
这场焦虑很快被Cognition做成了一份可以明码标价的商业答卷。6月4日,Cognition发布了“AI生产力保证”——如果企业客户使用Devin(Cognition推出的AI软件工程师产品)后,效率提升没有达到承诺水平,最高赔偿1000万美金。做这份研究的,是我一位拿过三块国际信息学奥赛金牌的同事,他调研了233个真实客户案例,随机抽取客户和Devin的对话,问客户“如果不用Devin,这段工作纯人工要花多久”,再用这些数据训练出一套预测系统,把每一次Devin对话,直接转化成“等效工程师小时数”,用工程师的时薪反推这套产品到底省下了多少。
但很多YC公司,可能还会继续“token maxxing”的模式,因为他们有很多政策优惠的免费token额度,再加上规模小,可能只有三个人,没有什么AI治理的问题,管理者能直接看到每个人到底是不是在用AI摸鱼。
观察8:模型崇拜本身也在被推翻
就在这篇稿子两次访谈的两周间隙里,我发现自己上一次讲的道理,已经开始不太对了。
两周前,我还在谈论哪个模型是当下最前沿的。现在,Cognition内部刚刚发布了一个还没有中文译名的功能,代号叫fusion mode——把多个便宜模型和顶尖模型融合调度使用,而不是无脑调用最贵的那一个。 你不会天天开你的保时捷去买菜吧,你应该去开你的本田或者便宜的车去买菜。这两周模型迭代的速度也超出了我的想象,连谁是“number one”这件事,都不敢说得太满。
我不能说所有的,但你可能说大于60%,很多可能是一个月之后就可能又是反着来的。
AI时代,“机会”藏在非共识里
任何技术浪潮演进的规律都是如此,旧共识破灭,往往正是新范式建立的开始。
当市场告别了对单模型和算力烧钱的盲目崇拜,围绕“如何让AI稳定可控地落地”以及“如何啃下大模型啃不动硬骨头”的需求便爆发出来。兼具工程师与投资猎头双重视角的马培元注意到,一批不依赖“大模型神话”、专注于解决真实世界复杂痛点的新生意,正在硅谷的非共识中悄然萌芽。
观察9:新的AI infra正在出现
围绕“Token-Maxxing”,其实已经出现了一批新的创业公司。他们专门观测、监控团队的AI使用情况,分析哪里在浪费token。
这背后更深一层的问题在于,AI agent本身是脆弱的。一个prompt的微小变化,就可能导致agent的表现变差了。于是新的AI infra(基础设施)开始出现,比如sandbox(沙盒环境),用来隔离agent运行,避免它直接接触敏感系统,比如银行账号或生产环境数据。
与此同时,“观测”本身也变得更复杂。传统系统只要报错就能被监控,但agent不会“报错”。它可以正常运行,却可能在输出层面出现严重问题,比如带有偏见、歧视,或者让用户产生明显负面体验。这就需要⼀套新的软件,去监测agent什么时候“脑⼦坏了”。
观察10:“不可训练的东西”,正在成为新生意
投资圈里有一种越来越流行的判断:vertical agent(垂直领域AI代理)已经失去投资价值。但我并不完全同意。
硅谷投资者郭睿(Sarah Guo)提出过一个概念——“the untrainable”,也就是“不可训练的东西”。核心观点是在很多垂直行业,语言模型永远无法完全自动化。因为垂直行业里充满大量无法被抽象掉的复杂流程,而且这些流程往往需要⼈⼒来不断地⼀个个解决。
比如美国报税,50个州有50个税,要一一慢慢对接;法律领域也是如此,移民法、民法、商法,各自体系复杂,AI agent没法一步到位。
垂直AI agent公司的价值,就在于不断和客户、FDE(前沿部署工程师)的互动中发现更多真实的痛点。这些东西会被烙印在公司的产品⾥,这也是其他⼤公司没有办法训练、不能被通⽤模型吃掉的东西。
所以,我倾向于认为vertical agent依然有投资价值。只是它们带来的可能不是1000倍的回报,而更可能是20倍、50倍,甚至100倍这种比较稳、比较小的回报。
身处AI浪潮中,你感受到的最大变化是?
欢迎在评论区分享你的看法~

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」

中层消失,Token狂热退潮,硅谷工程师眼里的「AI创业下半场」


来源:36氪

DisclaimerPlease read market information rationally and stay aware of investment risks. All content on this site is for informational purposes only and does not constitute investment advice.

Related Reading

Hardware wallet sales in Russia more than double as new crypto rules near

Wildberries’ average price for hardware wallets fell 13% to 7,900 rubles, and M.Video broadened its range of products, though neither retailer identified the…

US spot Bitcoin ETFs post best week since April with $1B inflows

The spot Bitcoin exchangetraded funds registered their thirdstrongest showing since October as institutional demand showed signs of renewed momentum.…

Brazil's central bank orders exchanges to delay large crypto transfers abroad

The rule applies to transfers above $10,000 and smaller transactions flagged as risky by exchanges. Source:CoinDesk

US Senate to vote on advancing CLARITY Act in September after Thune files cloture

The procedural move puts crypto market structure legislation back on track as lawmakers continue negotiations over ethics and stablecoin provisions.…

Sourcehttps://36kr.com/p/3918250549931394