Glean SWE New Grad 面试怎么准备:从企业搜索的筛人逻辑到高频考点
Glean SWE New Grad Interview Guide (2026)
阅读重点
企业搜索是个听起来不性感、做起来极难的方向:数据散落在几十个 SaaS 系统里,每条搜索结果都要先过权限这一关,错放一条就是安全事故。Glean 的面试考点,几乎都能从这个业务难度里反推出来。
Glean SWE New Grad 面试怎么准备:从企业搜索的筛人逻辑到高频考点
企业搜索是个听起来不性感、做起来极难的方向:数据散落在几十个 SaaS 系统里,每条搜索结果都要先过权限这一关,错放一条就是安全事故。Glean 的面试考点,几乎都能从这个业务难度里反推出来。
这家公司在筛什么人
Glean 由 Arvind Jain 于 2019 年创立——他此前是 Google 的 Distinguished Engineer,也是 Rubrik 的联合创始人,这份履历基本解释了公司的工程底色:搜索基因加企业级严谨。产品是企业内部搜索与 AI 工作助手:把 Google Drive、Slack、Jira、Confluence 等数据源统一索引,再叠加问答与 agent 能力。
工程上的三大难点,对应了面试的三个筛选面:
- 连接器工程:几十种数据源的同步、增量更新、格式解析——筛扎实的工程实现能力。
- 权限感知检索:每条结果必须尊重源系统的 ACL,而权限本身也在实时变化——筛系统设计里的严谨程度。
- 检索与 RAG 质量:排序、分块、召回与生成的协同——筛对搜索问题的真实兴趣。
ToB 属性还意味着:公司在乎你能否想象企业客户的使用场景,而不只是套用自己作为 C 端用户的直觉。
常见考察方向与作答示范
1. 设计权限感知的企业搜索系统(完整推演)。链路:connector 拉取文档与 ACL → 索引层同时维护倒排索引与向量索引,文档携带权限元数据 → 查询时做权限过滤。核心权衡在 early filtering(检索阶段就按用户可见集过滤,结果准但索引更复杂)与 late filtering(先检索再逐条鉴权,实现简单但可能过滤后结果不足,且有泄露面)。多数实践采用检索时过滤加查询后二次校验的组合。两个高频追问:权限变更如何生效——ACL 同步存在延迟窗口,原则是宁可漏出、不可多出(fail closed);缓存怎么做——绝不能跨用户复用结果缓存,只能缓存与权限无关的中间产物。能把「fail closed」原则主动讲出来,是这道题的分水岭。
2. 实现倒排索引并支持布尔查询(完整推演)。构建:分词后维护 term 到 posting list(有序文档 ID 列表)的映射。AND 查询即多个有序列表求交——双指针归并,复杂度 O(m+n);OR 是归并去重。追问优化:posting list 很长时用跳表指针加速求交,或按列表长度从短到长依次求交以尽早收窄。这道题的算法原型其实就是「有序数组求交集」,但要能从算法一路讲到搜索引擎的真实实现,体现知识纵深。
3. Trie 实现 autocomplete:扩展到 top-k 热门补全,Trie 节点挂堆或预计算前缀热榜。
4. RAG 分块策略讨论:固定窗口与结构感知分块(按标题、段落)的取舍,overlap 的作用,作者、时间、来源等元数据如何参与排序。
5. Rate limiter:token bucket,落在企业 API 配额场景。
6. Practical 排查题:客户报告「搜不到某篇文档」,怎么系统性排查?沿链路走:connector 是否同步到 → 是否成功索引 → 权限是否对该用户可见 → 是否被排序沉底。这类题考排查素养,ToB 公司尤其爱考,跳步猜结论是大忌。
流程怎么走
根据公开面经与候选人反馈整理:recruiter 电话 → 一轮技术电面 → virtual onsite 通常三到五轮(coding 两轮、system design 一轮、behavioral/hiring manager 一轮),部分团队会加 practical 或偏 ML 的讨论环节。coding 以 medium 为主但看重代码质量。具体安排因团队而异,以 recruiter 说明为准。
两周冲刺计划
- 第 1–4 天:搜索基础补课——倒排索引、BM25 直觉、向量检索概念各半天;把权限感知设计题自己推演一遍。
- 第 5–9 天:刷题 40 道左右——字符串、Trie、堆、双指针与归并;每题做完复述一遍权衡。
- 第 10–11 天:系统设计自练两场(企业搜索加一道通用组件如限流),计时 45 分钟。
- 第 12–14 天:behavioral 准备(围绕严谨与客户意识的真实例子),加一场完整 mock。
失误清单
- 用 C 端搜索的思路答题,通篇不提权限——在 Glean 的场景里这是最致命的遗漏。
- 只会向量检索的名词,讲不出倒排索引怎么实现。
- 排查类题目直接猜结论,而不是沿链路逐段验证。
- 完全不了解客户是谁,behavioral 里说不出对 ToB 场景的任何想象。
2025–2026 环境备注
企业 AI 助手赛道在 2025–2026 持续升温,竞争者既有初创也有办公套件巨头——尽调这类公司时,值得看的公开信号是客户案例与合作伙伴名单的更新频率。招聘节奏上,NG 岗位少而全年零散放出,盯官方 careers 页比等秋招更有效。国际学生的 sponsor 政策以公司官方与 USCIS 为准。
FAQ
Q:薪资怎么查? levels.fyi 加 Glassdoor,再用 H-1B 数据库的申报工资交叉验证;期权部分在 offer 阶段问清行权与稀释条款。
Q:需要搜索或 ML 背景吗? 不强制。工程轨看重 CS 基础与系统严谨性,把检索基础补到能参与讨论的程度即可。
Q:会有 take-home 吗? 因团队而异,部分候选人反馈有 practical 环节;时间有限时,优先保证现场 coding 的稳定发挥。
Q:内推重要吗? 有用。LinkedIn 上找校友或二度人脉,附一段具体的岗位匹配说明,比模板化私信有效。
