注册一亩三分地论坛,查看更多干货!
您需要 登录 才可以下载或查看附件。没有帐号?注册账号 
x
6, 7 月面的 content understanding 组mid level
技术电面
结构:自我介绍 → 为什么离开现在的公司 → 数据库 schema + SQL → 一道小系统设计 → 可观测性 → 反问。
- Schema / SQL: 给一个多对多关系建表(要求写出 join 表 + 复合主键),然后写查询
- 系统设计:用 LLM 给文档做富化(enrichment) —— 批量把文档喂给一个外部 LLM API,把结果写回
- 重点追问:调用第三方 API 被 429 限流了怎么办? 这题他给了将近 10 分钟,我一直没独立组装出答案,最后是他把思路给我的:读 → 写进一个共享缓存 → 整个 worker fleet 一起退避。单个 worker 自己退避是不够的,这是这题的考点。
- 还问了:怎么去重(原子认领 + lease)、怎么重放过去 5 天的数据(状态表 +窗口)
Onsite Round 1 — Coding ⚑ 挂在这轮
面试官在 Vancouver hub,组分两块:content trust(检测违规有害内容)和 content understanding(文档富化、生成 metadata)。开场明确说不许用 LLM 工具;说环境里没有真的数据库,代码跑不起来也没关系,重点是过程和讲解g>schema 怎么设计才能兼顾灵活性(我一开始给 Doc Chat 单独开了 question/answer 列,他说「你不算错,但我们要的是灵活性」)「你选了 Postgres。那数据仓库那条路呢——Redshift、S3 + Parquet、Spark?如果只能选一个你选哪个、为什么?」 这是这轮的核心权衡题保留策略Onsite Round 3 — Behavioral
标准题:最自豪的项目、项目中最大的模糊性/变更怎么处理、一次做出取舍的经历。
总结
Scribd 的 coding 轮不是考算法难度,是考 production mindset:幂等、校验失败怎么办、失败消息去哪、打什么指标、怎么报警。准备的时候按这条线练,比刷题有用。
他们 recruiter 很好把考什么都告诉你了,考点和别的公司不太一样 |