Quantitative Research 高强度八周进阶路线
使用说明与边界
这是一条面向 Quantitative Research 实习准备的深度优先、约两个月高强度路线,不是完整的数学金融课程,也不保证覆盖研究岗位所需的全部数学、统计、金融或软件工程内容。学习者假定具备微积分、线性代数、Python 和基础算法;概率统计基础有限,金融知识只作为研究语境。
- 时间预算:Week 1–2 每周 10–12 小时;Week 3–8 每周 15–20 小时。每周预算包含阅读、观看、实现、难题和阶段考核。
- 两条主线:数学/概率理论与统计研究/机器学习。金融只保留 return、covariance、factor intuition、transaction cost、backtest bias 和最低风险指标。
- 应用数学边界:必修 Markov chain、Poisson process、conditional expectation、martingale、stopping time、Brownian motion、quadratic variation、Itô lemma、OU process、state-space/Kalman filter。测度论只作 supporting note;Radon–Nikodym、Girsanov、measure change 和严格随机积分证明列为选做,不假装两个月完成。
- 工作方式:每周保存代码、数据说明、图表、随机种子、环境和短报告。结论必须区分模拟事实、统计证据与未经证明的金融解释。
- 项目策略:只做 2–3 个高质量项目;Kaggle 仅保留 2–3 个有明确研究目的的实验,不再每周强制提交。
- 问题难度:每周有理论/推导题或研究诊断题,另配 1–2 道中高级 LeetCode/算法题;这些不是 Two Sum 或 Contains Duplicate 主线。
目录
- Week 1:概率、条件期望、联合分布、收敛与金融最低背景
- Week 2:统计推断、MLE、GLS、似然检验、bootstrap、正则化与研究数据
- Week 3:离散随机过程与 stopping-time 思维
- Week 4:连续随机过程、Itô calculus 与 Kalman filter
- Week 5:时间序列、协整、因子模型、波动率与最低限度组合风险
- Week 6:机器学习深度与严格时间序列验证
- Week 7:研究设计、multiple testing 与高效可复现代码
- Week 8:统计信号模型 vs ML 模型的高难度 capstone
- 最终完成检查
- 最终 scope
Week 1:概率、条件期望、联合分布、收敛与金融最低背景
预算:10–12 小时。 目标是从随机变量语言进入研究,而不是背金融术语。
阅读与观看
必做·阅读阅读 Harvard STAT 110 课程教材页 中 conditional probability、expectation、variance、joint distributions 相关章节。必做·观看观看 MIT OCW 6.041 Lecture Videos 对应概率、条件概率和随机变量的讲次。推荐·阅读对照 MIT 6.041 Lecture Notes 的习题与证明。
主线与实现
- 推导 conditional expectation 的 tower property、independence 下的 factorization、joint/marginal/conditional density、covariance 与 total variance;说明 conditional expectation 是随机变量而不只是数字。
- 学习 almost sure、in probability、in distribution 的直觉,LLN/CLT 的条件与失败例子;用 simulation 比较 heavy-tail、dependent sample 与 iid 样本。
- 金融最低背景只包括 price/return、simple/log return、covariance、long/short、spread 和 benchmark;不展开债券、衍生品、完整投资管理或微观结构。
- 项目 1 起始:固定 seed,模拟 iid 与 dependent returns,输出联合散点图、条件均值、样本 covariance、收敛曲线和一页解释。
难题、面试与考核
中高级算法 1–2 题:LeetCode Monotonic Stack 题组 中选一题;另选 interval/line sweep 题,写 invariant、复杂度和边界证明。理论/推导题:证明Var(X)=E[Var(X|Y)]+Var(E[X|Y]),构造一个不满足 iid 时样本均值不按 iid 直觉收敛的 simulation,并解释图形。阶段考核:提交 2–3 页 probability note、simulation notebook 和金融最低背景术语表;必须注明哪些结果来自定理、哪些只是有限样本观察。
Week 2:统计推断、MLE、GLS、似然检验、bootstrap、正则化与研究数据
预算:10–12 小时。 目标是把概率模型转为可审计的统计研究。
阅读与观看
必做·阅读阅读 An Introduction to Statistical Learning 中 statistical learning、linear regression、resampling 和 regularization 相关章节。必做·观看使用 Stanford STATS 191 的讲义/视频索引学习 likelihood、regression inference 和 bootstrap。推荐·阅读阅读 scikit-learn Linear Models 对照实现,不把 API 输出当作证明。
主线与实现
- 推导 likelihood、score、Fisher information、MLE 的 asymptotic intuition;比较 OLS、MLE 与 GLS,说明异方差/相关误差下 GLS 的权重含义。
- 实现 likelihood-ratio test、Wald test、confidence interval、power simulation 和 nonparametric/bootstrap;记录 Type I error、multiple testing 的基本风险。
- 学习 ridge/lasso 的 bias-variance 取舍、正则化路径、特征标准化、缺失值、日期对齐、schema 和 look-ahead 防护。
- 项目 1:用研究数据做清洗 pipeline,比较 OLS/GLS/regularized model,报告系数不确定性、bootstrap 区间和残差诊断。Kaggle 实验 1 只允许用一个公开 tabular 数据集验证 pipeline,不以 leaderboard 为目标。
难题、面试与考核
中高级算法 1–2 题:interval merge/interval query 题,以及 union-find 或 shortest path 题;给出数据结构不变量和复杂度。理论/研究诊断题:手推正态线性模型的 MLE 与 GLS 目标函数;模拟异方差数据,比较 naive standard error、robust/GLS/ bootstrap 结论,写出错误研究者会如何误读 p-value。阶段考核:交付可从原始数据重建的 clean pipeline、统计报告、power/coverage 表和一次 leakage audit。
Week 3:离散随机过程与 stopping-time 思维
预算:15–20 小时。 目标是掌握离散随机过程的结构,而不是把 Markov chain 当作黑盒库。
阅读与观看
必做·阅读阅读 MIT OCW 6.262 Discrete Stochastic Processes 的 Markov chains、Poisson process 与 martingale 相关讲义。必做·观看观看 Harvard Stat 110 视频资源 中 conditional expectation、Markov chain 和 martingale 相关讲次。推荐·阅读阅读 MIT 6.262 课程资料 的习题。
主线与实现
- 离散 Markov chain:transition matrix、communicating classes、stationary distribution、detailed balance、mixing 直觉与 hitting time;用线性代数求 stationary distribution 并模拟收敛。
- Poisson process:inter-arrival、independent increments、thinning/superposition;比较离散计数与 Poisson approximation。
- conditional expectation、martingale、stopping time、optional stopping 的直觉;明确适用条件和“停止后仍可随意取期望”的错误。
- 项目 2 起始:实现 Markov chain hitting-time simulation 与 Poisson event simulator,和理论方程/Monte Carlo confidence interval 对照。
难题、面试与考核
中高级算法 1–2 题:union-find 连接性题和 weighted graph shortest path 题;说明 amortized complexity 或 heap invariant。理论/推导题:求 gambler's ruin 的 hitting probability/expected time;证明一个简单 martingale,并判断给定 stopping time 是否满足可用的 optional-stopping 条件。阶段考核:提交 transition-matrix 推导、hitting-time 方程、Poisson simulation 和一份“定理条件 vs 实验结果”诊断报告。
Week 4:连续随机过程、Itô calculus 与 Kalman filter
预算:15–20 小时。 目标是建立 applied mathematics 的深度边界:能推导和实现核心结果,但不声称完成测度论概率。
阅读与观看
必做·阅读阅读 MIT OCW 18.S096 Topics in Mathematics with Applications in Finance 中 Brownian motion、Itô lemma 和 stochastic-process notes。必做·观看观看 NYU Courant Probability and Stochastic Processes 中与 Brownian motion/Itô calculus 相关的公开课程资料。推荐·阅读阅读 Statsmodels statespace documentation 的 state-space/Kalman 实现说明。
主线与实现
- Brownian motion 的 increments、filtration 直觉、quadratic variation;用 partition simulation 观察 quadratic variation 收敛。
- 推导并应用 Itô lemma;Geometric Brownian Motion 只作例子,不作为金融课程主线。研究 Ornstein–Uhlenbeck process 的 mean reversion、stationary law 和 exact/discretized simulation。
- state-space model、hidden state、observation noise、prediction/update recursion 与 Kalman filter;比较 Kalman 与简单 rolling estimator。
选做·supporting note只做概念阅读:Radon–Nikodym、Girsanov、measure change、严格 stochastic-integral proofs;明确它们不属于两个月必修。- 项目 2:用 OU 生成数据,分别用 naive、MLE/OLS 离散估计和 Kalman filter 恢复状态,报告参数 bias、预测区间和模型失配。
难题、面试与考核
中高级算法 1–2 题:DP 题与 reservoir sampling/streaming top-k 题;说明状态定义、随机性不变量和空间复杂度。理论/推导题:计算d(X_t^2)或d f(t,X_t)的 Itô 展开;推导 OU 的 conditional mean/variance,并写出 Kalman 一步 update。阶段考核:交付手推笔记、quadratic-variation simulation、OU/Kalman notebook 和“GBM 只是例子、measure change 为选做”的边界说明。
Week 5:时间序列、协整、因子模型、波动率与最低限度组合风险
预算:15–20 小时。 目标是把随机过程和统计模型连接到有限的研究语境。
阅读与观看
必做·阅读阅读 Forecasting: Principles and Practice 的 stationary time series、ARIMA 和 dynamic regression 章节。必做·观看使用 Columbia IEOR time-series course materials 定位 ARMA、cointegration 和 factor 相关讲义。推荐·阅读阅读 statsmodels Time Series Analysis 的实现文档。
主线与实现
- weak stationarity、autocovariance/ACF、ARMA/ARIMA、unit root、differencing、cointegration 与 error-correction intuition;区分相关、预测与因果。
- factor model、beta/exposure、横截面排序、rolling volatility;金融只保留 return、covariance、factor intuition、transaction cost 和 minimum risk metrics(volatility、Sharpe 假设、drawdown)。
- 实现一个可解释的时间序列/因子 baseline,严格按时间切分;记录调整、缺失、频率、样本区间和数据 provenance。
- 项目 1 收尾:输出模型假设、参数估计、残差/稳定性诊断和至少一个失败结果;不做债券、衍生品或完整 portfolio optimization。
难题、面试与考核
中高级算法 1–2 题:randomized algorithm 题与 amortized-complexity 数据结构题,要求写期望复杂度或势能函数。理论/研究诊断题:证明/验证一个 AR(1) stationary condition;设计 spurious regression 与 cointegration simulation;诊断一个把 contemporaneous feature 偷渡进 label 的回测。阶段考核:提交时间序列研究 memo、协整/单位根诊断、因子暴露表、成本敏感性小表和 reproducible run。
Week 6:机器学习深度与严格时间序列验证
预算:15–20 小时。 目标是学习可验证的 ML,而不是堆叠模型。
阅读与观看
必做·阅读阅读 Stanford CS229 course materials 与 ISLP 中 bias-variance、regularization、PCA、trees/boosting 和 model assessment 部分。必做·观看观看 MIT 6.036 Introduction to Machine Learning 中 supervised learning、regularization 和 trees 讲次。推荐·阅读阅读 scikit-learn Cross-Validation、Common Pitfalls 和 probability calibration 文档。
主线与实现
- bias-variance、MLE connection、ridge/lasso、PCA、trees/random forest/boosting;理解 feature selection、scaling 和 missingness 对研究的影响。
- probability calibration、Brier/log loss、rank metrics;实现 nested time-series validation、rolling/expanding split、purged/embargoed CV,画出 label overlap 与 purge 区间。
- 建立 leakage diagnostics:fit transformer 只用训练期、冻结最终 test、检查 target construction、时间戳、feature availability 和 repeated tuning。
- 项目 3 起始:同一数据、同一 frozen test 比较统计 signal model 与 regularized/tree/boosting ML pipeline;只做一次有目的的 Kaggle 实验 2,研究 validation 与 leaderboard 差异,不追求排名。
难题、面试与考核
中高级算法 1–2 题:hard/medium DP 题与 randomized streaming top-k/reservoir sampling 题,说明状态、随机不变量和复杂度。理论/研究诊断题:从 squared loss 推导 ridge solution 的 shrinkage;构造一个 calibration 很差但 accuracy 尚可的例子;给定事件标签窗口,画出正确的 purged/embargoed folds 并指出 leakage。阶段考核:提交模型比较表、nested validation 图、calibration curve、leakage audit 和 frozen-test 结论;明确“不优于 baseline”也是有效结果。
Week 7:研究设计、multiple testing 与高效可复现代码
预算:15–20 小时。 目标是控制研究自由度,让结果经得起复核。
阅读与观看
必做·阅读阅读 The Probability of Backtest Overfitting 的 multiple testing/selection 讨论。必做·观看观看 MIT OCW 6.172 Performance Engineering 的 profiling、benchmark 和性能讲次。推荐·阅读阅读 Python Packaging User Guide、pytest documentation 和 Kaggle data leakage guidance。
主线与实现
- multiple testing、false discovery、selection bias、backtest overfitting、research registry、预注册假设、探索/确认分离;记录所有试验而非只记录最好结果。
- 设计成本敏感性:spread、commission、slippage、turnover 和执行时点;只报告 gross/net、最低风险指标与合理限制,不做投资建议。
- 将研究拆成 data/schema、features、models、validation、metrics、report;使用 tests、seed、configuration、logging、cache、profiling 和 vectorization。
- 项目 3:建立
src/、tests/、data/README、experiment_registry.csv和命令行入口;至少五个测试覆盖切分、label、成本、指标和随机性。Kaggle 只复盘前面的实验 1–2,不新增周赛。
难题、面试与考核
中高级算法 1–2 题:一道 amortized complexity/动态结构题和一道 shortest path/union-find 题;限时 45 分钟写出正确性证明。研究诊断题:给出 30 个候选信号、多个验证窗口和成本假设,设计 research registry、FDR/多重检验报告和 backtest-overfitting 审计;指出哪些自由度必须冻结。阶段考核:干净环境运行项目,生成 experiment registry、成本敏感性表、profiling 结果和一页 reproducibility audit;报告至少一个负面结论。
Week 8:统计信号模型 vs ML 模型的高难度 capstone
预算:15–20 小时。 这是 2–3 个项目中的最终高质量作品,不是另起一个浅层 notebook。
阅读与观看
必做·阅读重读 ISLP 的 model assessment/regularization 章节,并复核 scikit-learn model evaluation。必做·观看观看 Dartmouth COSC 74 Machine Learning 中与 generalization、model comparison 或 ensemble 相关的课程资料。推荐·阅读参考 Jane Street Research overview 和 Two Sigma careers 的研究岗位语言,只用于面试表达,不作为课程内容。
Capstone 必做规格
- 提出一个可证伪研究问题,同时定义统计 signal model(例如带正则化/状态空间的可解释模型)和 ML model;写出数学假设、目标函数、可识别性或适用条件。
- 使用同一数据 provenance、同一预测 horizon、严格 walk-forward/nested/purged validation 和一次 frozen test;说明 feature availability、label overlap、embargo 与所有调参决策。
- 比较 baseline、统计模型和 ML 模型的预测/分类指标、probability calibration、return/risk、turnover、gross/net 与 transaction-cost sensitivity;不以最高收益作为唯一成功标准。
- 写 multiple-testing disclosure、研究 registry 摘要、失败实验、稳健性(时间区间/参数/成本/子样本至少两项)和限制;禁止把相关性写成因果。
- 交付可复现 repository、
README、环境文件、测试、运行命令、数据说明、结果图和 1,500–2,500 字研究报告;报告结构为摘要、假设、推导、数据、方法、验证、结果、成本/风险、稳健性、限制、结论。
难题、面试与最终考核
中高级算法 1–2 题:从 monotonic stack、interval、union-find/shortest path、DP、reservoir sampling、randomized algorithm、amortized complexity 中抽题,限时完成并口述 trade-off。综合研究题:30 分钟内解释为何选择统计模型和 ML 模型、如何证明没有 leakage、如何解读 calibration、multiple testing 和成本敏感性;另完成一道 conditional expectation/Markov/martingale 或 Itô/Kalman 推导。阶段考核:提交 capstone 报告、作品集 README、两条不夸大的简历 bullet、150 字口头摘要、三张面试图和 45 分钟 Quant Research 模拟面试。通过标准是别人能复现主要结论,且你能清楚说明数据不能证明什么。
最终完成检查
- [ ] 能推导并解释 conditional expectation、joint distribution、MLE/GLS、bootstrap、Markov chain、Poisson、martingale、stopping time、Brownian、Itô、OU、Kalman。
- [ ] 能解释 ARMA/cointegration/factor intuition、bias-variance、regularization、PCA、trees/boosting、calibration、nested/purged/embargoed CV 和 leakage。
- [ ] 两到三个项目均有数学推导、simulation、统计检验、严格时间序列验证、成本敏感性、测试和可复现报告。
- [ ] 完成一次有目的的 Kaggle pipeline/validation 实验和一次复盘实验,不把每周竞赛提交当作主线。
- [ ] 中高级算法题覆盖 monotonic stack/interval、union-find/shortest path、DP、reservoir/streaming、randomized algorithm、amortized complexity;没有 Two Sum/Contains Duplicate 必做主线。
- [ ] 能在模拟面试中区分证明、估计、预测、回测和金融解释的边界。
最终 scope
这仍是约两个月的高强度 Quant Research 实习准备路线,采用应用数学深度边界:核心随机过程和统计/ML 研究方法必须能推导、实现和诊断;测度论及严格随机积分理论仅作选做 supporting note。金融知识被有意压缩为 return、covariance、factor intuition、transaction cost、backtest bias 和最低风险指标,债券、衍生品、完整投资管理与微观结构课程已删除或降级。完成路线不等于完成完整数学金融课程、不保证实习,也不构成投资建议。