注册一亩三分地论坛,查看更多干货!
您需要 登录 才可以下载或查看附件。没有帐号?注册账号 
x
整理了 6 篇 2026 年 Cohere 实战帖 + 2 篇 2024 参考,以及地里面经题库 Cohere 专区(2 OJ)。先说结论:Cohere 的面试分两条线——MLE/MTS 线(post-training 为主:numpy 手写 top-k sampling、decoding strategies、post-training 全流程 SD、research paper 答辩)和 SWE 线(OA + Glean-like 企业 AI agent SD);Data Engineer 有独立的 7 天 take-home(JSONL 解析 + HM 45 分钟 deep dive,bar 极高)。8 篇全部登录打开核验,题面引用楼主原话。
一、流程概览
- MLE/MTS(post-training):HR → SD(post-training 全流程:7B model coding 能力的 data collection、SFT、RLHF、evaluation、inference engine、feedback loop)→ ML coding(numpy 实现 top-k sampling)→ research paper presentation;有楼主称 rounds 间隔 3–4 天,全程约 1.5 个月,但两篇贴出此线的帖子都止步于这些轮次(结果 Fail),帖中未见有人走完到 offer。
- SWE(agent platform):OA(python string parsing)→ HM behavioral call → SD(企业级 AI research agent)→ VO(debug + coding)。
- Data Engineer:take-home(7 天,建议 1.5 小时内完成,伪代码)→ 45 分钟 HM walkthrough。
- 前端:SD(实时评论系统)+ UI 轮(信用卡表单)。
- 注意:有楼主称"Cohere does not sponsor"(签证);HR 曾忽略 3–4 封 reschedule 邮件。
二、高频题
1. Top-k / decoding strategies(MLE 签名题)——"Cohere ML Coding Interview Q1 — Decoding Strategies":starter 给 RandomGPT 类(vocab_size=10,forward 伪随机 logits,softmax 方法)。实现:greedy_decode(argmax 最可能序列);topk_decode(top-k sampling);topp_decode(前两问做完才做)。断言:greedy_decode(gpt, [4, 0, 1], 7) == [7, 7, 4, 0, 7, 2, 4];topk_decode(gpt, [4, 0, 1], 9, k=3) == [7, 4, 3, 1, 5, 1, 5, 5, 0, 2, 6];topp_decode(gpt, [4, 0, 1], 15, p=0.8) == [4, 6, 3, 1, 7, 6, 4, 0, 0, 3, 0, 2, 4, 2, 0, 3, 0, 0, 6]。Q2:"Flaws of Top-k: What are the flaws of top-k decoding?" Q3:"Explain Top-p: Explain top-p decoding."(2026-6-12,Pass)。另一帖:"用numpy实现top K sampling 注意要用numpy实现"(2026-4-25,楼主只准备了 PyTorch,"人都慌了")。题库 OJ:"Implement top-k sampling using NumPy"。
2. Post-training 全流程 SD——"设计post training流程提升7B model的coding capabilities for an ente直接跳过我准备的slides,问了很多paper里面的缺点");(4) HM BQ;结果 Fail
R2. 2024-4-6,匿名,本科,应届生,intern OA:1 小时 3 道 easy;"给一个数字string多个'5'删除'5'后最大的数字";结果未知
地里面经题库:2 OJ(2026-09-20 核验):"Implement top-k sampling using NumPy"、"Live Coding: Replace a Heuristic Python Implementation of a Terminal Text-Based Game with an LLM-Driven One"
五、备考建议
1. Decoding:numpy 手写 greedy/top-k/top-p sampling(断言背熟);top-k 的 flaws、top-p 原理;knowledge cutoff 实现思路。
2. Post-training:SFT/RLHF 全流程能讲深(data 构建、reward model 选择、"为什么还需要 RLHF");evaluation、inference engine、feedback loop。
3. Paper 答辩:主动 highlight 自己 paper 实验设置的不足 + 领域最新进展;面试官对 paper 很熟,别当 reading group 讲。
4. SWE:python string parsing(callable introspection);Glean-like agent SD(retrieval 内外源、citation、caching 相似度、权限 revoke;"让 model 自己 plan + function calling")。
5. DE:JSONL 入仓全流程(schema、validate、dedup、幂等、Spark skew);missing 值处理(0 vs NULL vs delete)的 trade-off。
6. 心理准备:bar 极高,"incredibly high technical bar";不 sponsor 签证(单人说法);HR 流程可能拖沓。
---
已发布的《Harvey面经汇总》《Spreadsheet设计题全解析》见我主页,评论区欢迎补充 2026 新题,码字不易,求加精、求大米支持,谢谢!
---
|