通用 ML 与 PyTorch 是主体
Shape、broadcasting、loss、MLP、训练循环、metrics、debugging、baseline 和模型选择,跨公司重复出现。MSE 和 MLP 不是“太简单”,而是所有高级题的依赖。
EVIDENCE ATLAS · TECHNICAL QUESTION BANK · FIELD GUIDE
这不是一张“两周速成清单”,而是一套可以读数周、反复练习、继续更新的 AI for Science 面试参考书。先用 135 条真实记录划定边界,再把每种能力做成可运行的 PyTorch 题、case、repo 阅读和 PR review。
01 / WHAT THE EVIDENCE ACTUALLY SAYS
Shape、broadcasting、loss、MLP、训练循环、metrics、debugging、baseline 和模型选择,跨公司重复出现。MSE 和 MLP 不是“太简单”,而是所有高级题的依赖。
蛋白题面改变 amino-acid token、padding、homology split、结构单位、约束、validity 与 wet-lab 验证。它不替代机器学习基本功,也不能被完全删掉。
可靠粒度是 attention 或 mask、VAE reparameterization/KL、diffusion forward noising/noise loss。没有证据支持完整 Transformer、VAE 或 diffusion pipeline 是默认题。
02 / THE FOUR-VOLUME SET
EVIDENCE ATLAS
按公司、岗位、领域、能力、相关性和来源筛选。统计只描述本样本,不伪装成出题概率。
100 CORE + 35 SUPPLEMENT ↗TECHNICAL QUESTION BANK
完整 PyTorch 参考答案、最小测试、评分点、追问、ML fundamentals 与 scientific case。
60+ QUESTIONS · FULL ANSWERS ↗LILA FIELD GUIDE
Lila 一手流程、repo 预读、unseen PR rubric、14 个详细 review 情境与 14 天计划。
CONFIRMED / OBSERVED / PRACTICE ↗JOB SEARCH OPERATING SYSTEM
岗位谱系、JD 精读、申请组合、简历、research narrative、面试循环、offer 尽调和持续复盘。
21 CHAPTERS · REUSABLE TEMPLATES ↗03 / LILA: FACTS BEFORE PRACTICE
蛋白设计或相邻题面;不考 CV;“super small, half an hour, nothing super complicated”;现场不能用 AI。
定义问题、数据、baseline、模型、loss、metric、失败分析和实验验证;中间会持续追问。
预读 repo 时可以用 AI;面试时解释已读代码,再理解新 PR。具体 repo、技术栈、PR 大小和 rubric 未知。
talk 名义约一小时,但建议准备可压到约 40 分钟的版本,因为提问很多;另有多场约 30 分钟 one-to-one。
04 / THE TWO-WEEK ENTRY PATH
验收不是“看懂”,而是无 AI 写出、运行、用 toy batch overfit,并解释每个 shape。
只练半小时适配粒度。第一周末做一次完整三轮模拟,按错误日志补基础。
把领域覆盖层加到通用能力上:homology leakage、missing atoms、units、equivariance、cache 和 checkpoint。
Day 14 减量,不再开新主题。最低、标准和冲刺三条路径都在 Lila 卷内给出。
05 / RESEARCH BOUNDARY
三场技术面、无 AI、repo + PR、约 40 分钟可裁剪 talk 都是面试官亲自说明,不是网上推测。
PathAI、Tempus、Genentech、10x、Anthrogen、Slack、Snyk、Deliveroo 等分别补足 coding、case、talk、repo 和 PR。
网页不把未知填成“高频题”。所有模拟题都带 Practice Variant 标签,并说明推导链。