AFS / 01INTERVIEW FIELD MANUAL Reading ↗

EVIDENCE ATLAS · TECHNICAL QUESTION BANK · FIELD GUIDE

别猜题。
建立证据。

这不是一张“两周速成清单”,而是一套可以读数周、反复练习、继续更新的 AI for Science 面试参考书。先用 135 条真实记录划定边界,再把每种能力做成可运行的 PyTorch 题、case、repo 阅读和 PR review。

● LILA CONFIRMED ◆ OBSERVED ELSEWHERE ◇ PRACTICE VARIANT
135逐页打开并编码的面试记录;100 条核心,35 条补充
73家公司;AI for Science、小型蛋白公司、研究实验室与方法对照
03Lila 三场技术面:live coding、ML case、code comprehension

01 / WHAT THE EVIDENCE ACTUALLY SAYS

你的假设方向对了,但“纯计算机”不是 LeetCode。

SUPPORTED

通用 ML 与 PyTorch 是主体

Shape、broadcasting、loss、MLP、训练循环、metrics、debugging、baseline 和模型选择,跨公司重复出现。MSE 和 MLP 不是“太简单”,而是所有高级题的依赖。

REFINED

蛋白是领域覆盖层

蛋白题面改变 amino-acid token、padding、homology split、结构单位、约束、validity 与 wet-lab 验证。它不替代机器学习基本功,也不能被完全删掉。

NOT SUPPORTED

半小时写完整生成模型

可靠粒度是 attention 或 mask、VAE reparameterization/KL、diffusion forward noising/noise loss。没有证据支持完整 Transformer、VAE 或 diffusion pipeline 是默认题。

02 / THE FOUR-VOLUME SET

短期过 Lila,长期可迁移。

03 / LILA: FACTS BEFORE PRACTICE

目前真正已知的,只有这些。

LIVE CODING

从零写 PyTorch 与 basic ML primitives

蛋白设计或相邻题面;不考 CV;“super small, half an hour, nothing super complicated”;现场不能用 AI。

LILA CONFIRMED
ML CASE

口头走一个机器学习问题

定义问题、数据、baseline、模型、loss、metric、失败分析和实验验证;中间会持续追问。

LILA CONFIRMED
CODE COMPREHENSION

提前 repo,加一份现场 unseen PR

预读 repo 时可以用 AI;面试时解释已读代码,再理解新 PR。具体 repo、技术栈、PR 大小和 rubric 未知。

LILA CONFIRMED
FINAL

Conversational one-to-ones 与 research talk

talk 名义约一小时,但建议准备可压到约 40 分钟的版本,因为提问很多;另有多场约 30 分钟 one-to-one。

LILA CONFIRMED

04 / THE TWO-WEEK ENTRY PATH

基础先闭环,再覆盖高级模型。

DAYS 01–04

Tensor、loss、MLP、train/eval、debug

验收不是“看懂”,而是无 AI 写出、运行、用 toy batch overfit,并解释每个 shape。

P0 · 50%
DAYS 05–07

Attention、mask、VAE 与 diffusion 最小组件

只练半小时适配粒度。第一周末做一次完整三轮模拟,按错误日志补基础。

P1/P2 · 25%
DAYS 08–10

Protein data、split、geometry 与 production

把领域覆盖层加到通用能力上:homology leakage、missing atoms、units、equivariance、cache 和 checkpoint。

DOMAIN LAYER
DAYS 11–14

HM、talk、真实 repo 与全流程模拟

Day 14 减量,不再开新主题。最低、标准和冲刺三条路径都在 Lila 卷内给出。

SIMULATE

打开逐日计划 ↗

05 / RESEARCH BOUNDARY

没有找到 exact Lila 原题。这一点本身很重要。

KNOWN

当前流程来自一手录音

三场技术面、无 AI、repo + PR、约 40 分钟可裁剪 talk 都是面试官亲自说明,不是网上推测。

OBSERVED

近邻记录定义题型和评分信号

PathAI、Tempus、Genentech、10x、Anthrogen、Slack、Snyk、Deliveroo 等分别补足 coding、case、talk、repo 和 PR。

UNKNOWN

prompt、repo 与 rubric 仍未知

网页不把未知填成“高频题”。所有模拟题都带 Practice Variant 标签,并说明推导链。

审计全部记录与方法 ↗