
点击“蓝字” 关注我们

我在 Google干10年Search工程师,后来我在自己的独角兽里找不到一份内部文档?

我曾经是Google早期搜索工程师,也在Rubrik做到联合创始人兼工程副总裁。听起来我应该最懂搜索这件事。可2018年的一个下午,我在自己800人的独角兽公司里,花了30分钟、问了5个同事,仍然找不到一份内部销售竞品分析文档。那一刻,我突然意识到真正困住企业的,不是没有信息,而是信息散落在Slack、Google Drive、Confluence、Jira、Salesforce里,谁也无法快速找到答案!别人也许会把这当成小麻烦,我却看见了一个全球性的企业痛点。后来我离开 Rubrik,创立Glean,把这次崩溃变成估值72亿美元的AI搜索公司。请继续读下去,看看我是怎样从一份找不到的文档里,看见下一家公司机会的。
本篇正文共6240字,预计阅读时间15分钟

简介
产品名称:Glean
成立时间:2019年3月
创始人:Arvind Jain、T.R. Vishwanath、Tony Gentilcore
员工人数:约800名
经济收入:ARR约3亿美元,估值72亿美元,约500亿人民币
产品定位:企业AI搜索与知识管理平台
核心功能:跨越Slack、Google Drive、Notion、Salesforce、Jira、Confluence等100多种企业工具,帮助员工快速搜索内部文档、项目资料、客户信息和公司知识。
创业起点:Arvind Jain曾是Google早期搜索工程师,却在自己创办的独角兽公司Rubrik里找不到一份内部文档,由此发现企业内部信息分散的巨大痛点。
主要客户:Reddit、Pinterest、Databricks、Confluent、Zendesk、Tinder、Workday、Sony等500多家企业。

这是2018年的我。43岁。Rubrik联合创始人兼工程副总裁。Rubrik是我和3个朋友在2014年创立的云数据管理公司。4年时间我们从0做到年收入2.5亿美元,估值13亿美元,硅谷顶级独角兽之一。
那一年某个下午我坐在Rubrik办公室里找一份内部文档。这是一份我们公司6个月前做的销售竞品分析报告。我清楚记得我们PM写过这份文档。但我在公司内部找了30分钟,问了5个同事,搜了GoogleDrive、Slack、Confluence、Jira,都没找到。最后我直接给PM发邮件。他说文档在我们公司内部wiki上。我去wiki上确实找到了,但藏在一个完全没人维护的分类下。
那一晚我躺在PaloAlto公寓里失眠3小时。我心里只有一个念头。我是前Google第2号搜索工程师。我帮Google建过搜索引擎处理全世界60亿张网页。但我在我自己的公司里都找不到一份内部文档。如果连Rubrik这种800人的独角兽都这样痛苦,那全球500万家公司每天面临的内部搜索痛苦,加起来是1万亿美元市场。
7年后的2026年。我2019年离开Rubrik创立的公司Glean,已经成为全球企业AI搜索领域的领导者。我们的AI助手能跨过100多种企业内部工具,从Slack到GoogleDrive到Notion到Salesforce,自动搜索答案。我们的客户包括Reddit、Pinterest、Databricks、Confluent、Zendesk、Tinder、Workday、Sony等500多家大企业。2025年6月最新一轮融资完成。估值 72亿美元,约500亿人民币。FastCompany2024年评我们为全球最有创新的AI应用公司第一名。
这是一个AI创业故事。但它的真正起点不是2019年创立Glean。是2018年那一个下午,我作为前Google搜索工程师,在自己的独角兽公司里找不到一份内部文档。我做对的最关键一件事,是我没有把这件事当成小事忍过去。我把它当成了我的下一家公司的起点。

我原本是印度中产家庭出身,IIT毕业到Google早期员工
我叫ArvindJain,1975年出生在印度新德里一个普通中产家庭。我父亲是政府工程师,母亲是中学数学老师。我从小数学和编程极好。1993年我18岁,考入印度顶级工科学院IIT鲁尔基。IIT鲁尔基计算机系当时每年录取50个学生,从全印度50万考生里筛出来。我是其中之一。
1997年我22岁IIT毕业。我做了一个让我父母震惊的决定。我没有继续读研究生,直接申请去美国工作。1997年我加入华盛顿州雷蒙德的微软。在微软待了3年,做Office团队工程师。然后我看到1999年Google刚刚成立1年,融了2500万美元A轮。当时Google只有40个员工。我有一个IIT校友在Google早期团队,他强烈推荐我加入。
2000年我25岁,加入Google。我是Google第2号搜索工程师,公司总员工号约第200号。我直接和创始人LarryPage和SergeyBrin一起工作。前5年我帮Google把搜索引擎扩展到处理全球60亿张网页。后来又做GoogleMaps第一版工程师、GoogleYouTube早期工程师。我在Google工作了整整10年。
2010年我35岁,离开Google。原因是Google已经从40人创业公司长成2万人巨头,决策流程让我极度不适。我想再次回到创业。但我那时候不知道做什么。我休息了4年,做了多个小项目、做天使投资、写代码、陪家人。这4年看起来是浪费时间,其实是我创业生涯最重要的4年。我看了100多个创业项目,跟200多个创始人聊过。这让我对硅谷的真正问题有了深刻认知。
Rubrik做到800人时,我在自己公司里找不到文档?
2014年我39岁,和3个朋友联合创立Rubrik。BipulSinha是Lightspeed风投合伙人。SohamMazumdar是Cloudera前工程师。ArvindNithrakashyap是我IIT校友。我们做的事是云数据管理,简单说就是企业的数据自动备份和恢复。这是一个传统但巨大的市场。我们4年时间从0做到年收入2.5亿美元,员工800人,估值13亿美元。我是Rubrik工程副总裁。
2018年我开始注意到一件让我极度焦虑的事。Rubrik内部已经有了多种工具。GoogleDrive存文档。Slack沟通。Confluence做wiki。Jira管理项目。Salesforce管销售。Workday管HR。GitHub管代码。每个工程师每天用8到12个不同工具。每周我们公司新生成5000个新文档、20万条Slack消息、几千个Jira任务。所有这些信息分布在8到12个不同的孤立系统里。
这种孤立带来3个严重问题:
▸第一。工程师每天花30%时间找信息。Rubrik800人乘以30%等于240个全职岗位在找信息。一年浪费工资3000万美元;
▸第二。新员工入职后6个月才能找到自己工作所需的内部知识。这意味着每个新员工的前6个月生产力损失50%;
▸第三。同样的问题在公司内部被重复回答10次。一个销售在Slack问的问题,可能已经有5个同事在过去6个月回答过类似问题,但她不知道;
2018年某个下午我自己在Rubrik内部找一份销售竞品分析文档。花了30分钟,问了5个同事,搜了4个不同工具,最后才在内部wiki里找到。那一晚我躺在PaloAlto公寓里失眠3小时。我心里只有一个念头。
我是前Google第2号搜索工程师。我帮Google处理过全世界60亿张网页。但我在我自己的公司里都找不到一份文档。这不是Rubrik的问题。这是全球500万家公司每天面对的问题。如果有一种AI工具能跨过所有这些孤立的企业系统,自动搜索答案,那是一个1万亿美元的市场。这件事必须我自己来做。
企业搜索的真正难点不是搜索,是权限和上下文
2018到2019年我用6个月时间深度调研企业搜索这个市场。我见了50多家公司的CTO和CIO。我发现一件让所有人都不理解的事。企业搜索这个问题,过去20年里有几十家创业公司试过解决,全部失败。我研究了所有这些失败案例后看清楚3个真正的难点。
第一个难点。权限管理。企业内部数据有严格权限。CEO能看的董事会文档,普通工程师不能看。HR部门的薪资数据,销售部门看不到。一个搜索工具如果不能正确处理权限,会暴露员工不该看的数据,公司直接被起诉;
第二个难点。上下文理解。同一个词在不同公司、不同部门有不同含义。Tinder公司里的match和Pinterest的match完全不是一个意思。一个公司的Q3销售复盘文档跟另一家完全不同结构。如果不能学会公司内部的语境,AI搜索就没法准确;
第三个难点。新员工的认知边界。一个新员工进入公司,前3个月连专有名词都不懂。她在Slack看到同事说ARC,根本不知道ARC是项目代号还是某个客户名。AI搜索必须能理解新员工的认知边界,主动给她解释专有名词,提供上下文。
2019年2月我看清楚一件事。要解决这3个难点,必须用大语言模型(LLM)作为底层。LLM能学习公司的语境,能理解权限,能跨过多种工具的数据。但2019年LLM还不成熟。GPT-2刚发布。我们要么自己训模型,要么等技术成熟。我选择等。
2019年3月我正式辞掉Rubrik工程副总裁职位。我邀请了2个Google老朋友一起创业。T.R.Vishwanath当时在Google做分布式系统首席工程师。TonyGentilcore之前在Twitter和Pinterest做工程副总裁。我们3个人组成了Glean的核心团队。
第一次行动是在2019年3月在PaloAlto一栋小办公楼里成立Glean
2019年3月我们3个人正式成立Glean。在PaloAlto一栋200平米办公楼里。Glean这个名字来自英文动词toglean,意思是从大量信息里挑出最有价值的部分。我们做了3个关键的早期决定。
第一个决定是先做"集成",再做"AI"。2019年我们花了18个月专门做企业工具的集成。我们的产品要能无缝集成Slack、GoogleDrive、Confluence、Jira、Salesforce、GitHub、Notion、Workday、Zoom等80多种企业工具。每集成一个工具要3个月。我们花了18个月把50个主流工具集成进来。这是任何创业公司都不愿意做的脏活累活,但这是真正的护城河;
第二个决定是AI模块独立,可以随时换底层模型。我们的AI模块设计成能随时换底层LLM。2019年我们用GPT-2测试。2020年用GPT-3。2022年11月ChatGPT出来我们立刻接入GPT-3.5。2023年用GPT-4。2024年我们开始训练自己的专属LLM。这种模块化让我们能跟上AI技术进步;
第三个决是卖给100到5000人规模的中大型科技公司,不卖给Fortune500。大部分SaaS创业公司梦想Fortune500大客户。我们反向锁定100到5000人规模的科技公司。原因有3个。一是这些公司决策快、付费快、ARR周期短。二是这些公司是SaaS工具使用率最高的客户。三是这些公司CTO看到产品就能拍板,不需要走Fortune500那种18个月内部审批。
2020年COVID让所有SaaS销售暂停12个月
2019到2020年我们埋头做产品。我们融了A轮1500万美元,投资人是Lightspeed和GeneralCatalyst。但2020年3月COVID爆发。整个硅谷SaaS销售暂停12个月。所有公司都把IT预算砍50%。我们刚做出来的产品没人愿意买。我们烧钱速度每月60万美元。我们2020年中只剩18个月现金。
2020年8月我和T.R.、Tony在PaloAlto我家后院开了一个4小时复盘会。我们3个人讨论一个问题。要不要pivot到其他方向?要不要砍员工保现金?要不要等COVID结束?
最后我们决定3件事:
▸第一。坚持企业AI搜索这个方向,不pivot。COVID让远程办公成为常态,企业内部信息更分散,我们的产品价值反而更大;
▸第二。砍30%招聘计划,但不砍现有员工。我们要保住团队气势;
▸第三。免费给我们认识的50家科技公司用6个月。让他们爱上产品;
这第3件事是关键是我们免费给Reddit、Confluent、Databricks、Pinterest、Box、Affirm等50家硅谷科技公司用Glean。6个月后这些公司里的工程师全部上瘾。当我们2021年开始收费时,这50家公司里38家立刻签合同。每家年付20万到200万美元。我们2021年ARR一夜从0涨到1000万美元。
2022年11月ChatGPT发布。一夜之间企业AI这个赛道从冷门变成最热门。我们的客户数从50家涨到200家。2023年8月我们完成D轮融资。2亿美元,估值22亿美元。Sequoia领投。
4个反共识让Glean成为ChatGPT之后最热门企业AI
①反共识1。先做集成,后做AI。
我们2019到2020年花18个月专门做企业工具集成,不做AI。集成80多种企业工具是脏活累活,但这是真正的护城河。等ChatGPT出来时,我们已经集成完毕,可以立刻接入LLM。如果先做AI再做集成,我们2023年根本接不住ChatGPT红利。普通人创业的对应思路是,在AI浪潮里,AI不是最难的部分。最难的是数据集成、权限管理、上下文理解这些基础工程;
②反共识2。AI模块独立,可随时换底层模型。
大部分AI创业公司绑定一家底层模型。我们反向把AI模块设计成能随时换。2019GPT-2,2020GPT-3,2022GPT-3.5,2023GPT-4,2024自训。这种模块化让我们能跟上AI技术进步。普通人AI创业对应思路是,永远不要绑定一家底层模型。今天的GPT-4明天可能被Claude5或者Gemini3替代。模块化是AI时代必需的架构原则;
③反共识3。卖中型科技公司,不卖Fortune500。
大部分SaaS创业公司梦想Fortune500大客户。我们反向锁定100到5000人规模科技公司。这些公司决策快、付费快、CTO看到产品就能拍板。Fortune500决策周期18个月,预算审批一年。普通人创业的对应思路是,永远先找最痛、付钱最快、决策最简单的客户。不要被巨头客户的虚荣心迷惑;
④反共识4。免费6个月让客户上瘾,再开始收费。
2020年COVID期间我们免费给50家公司用6个月。6个月后38家立刻签合同。如果我们day1就收费,COVID期间0客户。这种长期免费策略让我们安全度过COVID寒冬,还积累了一群超级忠诚客户。普通人创业的对应思路是,初创公司的免费试用周期应该长到客户上瘾为止。3天试用不够,30天不够,6个月才够。让客户离不开你,再开始收费。
6年从0到72亿美元估值,500家大企业客户
从2019年3月成立到2026年的关键里程碑:
▸2019年3月。Glean在PaloAlto成立。3个创始人;
▸2020年1月。A轮1500万美元,估值8000万美元;
▸2020年3月。COVID爆发,免费给50家科技公司用;
▸2021年6月。38家公司转付费,ARR1000万美元;
▸2022年5月。C轮1亿美元,估值10亿美元。独角兽;
▸2023年8月。D轮2亿美元,估值22亿美元;
▸2024年9月。E轮2.6亿美元,估值46亿美元;
▸2025年6月最新。F轮1.5亿美元,估值72亿美元,约500亿人民币。500家大企业客户。ARR约3亿美元;

我住在PaloAlto一栋普通房子里。我每天6点起床,7点跑步,8点到办公室。每天工作12小时。我的妻子是医生,我有2个孩子,分别16岁和14岁。我每周一定花1天和家人在一起,从不破例。这是我创业25年来唯一一件没变的事。
①你下一家公司的种子,藏在你现在公司的痛点里。
我作为前Google搜索工程师,在自己的独角兽公司里找不到一份内部文档。这种痛苦是我创立Glean的真正起点。普通人创业的对应思路是,永远记录你每天在公司里遇到的痛苦。每周整理一次。3个月后回看,重复出现5次以上的痛苦就是你的创业方向。中国对应思路是,写一份《我在公司里每天痛苦的100件事》文档,持续记录半年。这就是你的创业地图;
②在AI浪潮里,AI不是最难的部分。基础工程才是。
我们2019到2020年花18个月专门做企业工具集成,不做AI。集成80多种工具是脏活累活,但这是真正的护城河。等ChatGPT出来我们已经准备好。普通人AI创业的对应思路是,先做集成、做权限、做数据基础,再做AI模型。AI模型可以从开源拿,集成是抢不来的。中国对应思路是,做AI财税要先集成金税系统、电子发票系统、银行系统。做AI法律要先集成法院判决数据库、律师事务所案件系统。基础先于AI;
③AI模块要可替换,永远不要绑定一家底层模型。
我们的AI模块设计成能随时换底层LLM。2019GPT-2,2020GPT-3,2022GPT-3.5,2023GPT-4,2024自训。这种模块化让我们能跟上AI技术进步。普通人AI创业对应思路是,今天的GPT-4明天可能被Claude5替代。永远不要把你的产品架构绑死一家底层模型。模块化是AI时代必需的架构原则;
④永远先找最痛、付钱最快、决策最简单的客户。
大部分SaaS创业公司梦想Fortune500大客户。我们反向锁定100到5000人规模科技公司。这些公司CTO看到产品就能拍板。Fortune500决策周期18个月。普通人创业对应思路是,不要被巨头客户的虚荣心迷惑。中国对应思路是,先服务字节、美团、滴滴、拼多多这种1到5万人规模的互联网公司,再去服务银行、央企。决策周期差10倍;
⑤免费6个月让客户上瘾,再开始收费。
2020年COVID期间我们免费给50家公司用6个月。6个月后38家立刻签合同。如果day1就收费,COVID期间0客户。普通人创业的对应思路是,初创公司的免费试用周期应该长到客户上瘾为止。3天不够,30天不够,6个月才够。让客户离不开你,再开始收费。这种长期免费策略让你度过任何寒冬。
我太太每天还问我什么时候退休?
我现在51岁,Glean团队800人。我每天6点起床,7点跑步,8点到办公室。每天工作12小时。我太太每天还问我什么时候退休。我永远回答同一句话。等我看不到下一个改变行业的机会的那一天;
2010年我离开Google时35岁。我休息了4年,做天使投资、写代码、陪家人。这4年看起来像浪费,其实是我创业生涯最重要的4年。2014年我创立Rubrik,做了5年。2018年我看到企业搜索的真正痛点。2019年我创立Glean,做了7年。我创业生涯12年里,真正在做的事只有2件,找出全球性大痛点,集中精力解决它。其他时间都是积累、休息、思考;
过去7年我做对的最重要一件事,不是创立Glean,不是7.2亿融资,不是500亿人民币估值。是2018年那一个下午,我作为前Google搜索工程师,在自己公司里找不到一份文档。我没有把这件事当成小事忍过去。我把它当成了我的下一家公司的起点。普通人创业最大的浪费,是把每天遇到的痛苦当成正常状态忍下去。这些痛苦每一个都是市场机会。你记录、整理、深入思考的能力,决定你能不能看到这些机会。

创业机会有时并不藏在宏大的趋势里,而是藏在我们每天反复抱怨、却习惯性忍受的细节里。对我来说,那份找不到的文档,撕开了企业知识管理的裂缝,也打开了Glean 的起点。

识别图中二维码
关注我们
#创业 #市场 #科技 #创业故事
夜雨聆风