# Quantitative Research 高强度八周进阶路线

## 使用说明与边界

这是一条面向 Quantitative Research 实习准备的**深度优先、约两个月高强度路线**，不是完整的数学金融课程，也不保证覆盖研究岗位所需的全部数学、统计、金融或软件工程内容。学习者假定具备微积分、线性代数、Python 和基础算法；概率统计基础有限，金融知识只作为研究语境。

- **时间预算**：Week 1–2 每周 10–12 小时；Week 3–8 每周 15–20 小时。每周预算包含阅读、观看、实现、难题和阶段考核。
- **两条主线**：数学/概率理论与统计研究/机器学习。金融只保留 return、covariance、factor intuition、transaction cost、backtest bias 和最低风险指标。
- **应用数学边界**：必修 Markov chain、Poisson process、conditional expectation、martingale、stopping time、Brownian motion、quadratic variation、Itô lemma、OU process、state-space/Kalman filter。测度论只作 supporting note；Radon–Nikodym、Girsanov、measure change 和严格随机积分证明列为选做，不假装两个月完成。
- **工作方式**：每周保存代码、数据说明、图表、随机种子、环境和短报告。结论必须区分模拟事实、统计证据与未经证明的金融解释。
- **项目策略**：只做 2–3 个高质量项目；Kaggle 仅保留 2–3 个有明确研究目的的实验，不再每周强制提交。
- **问题难度**：每周有理论/推导题或研究诊断题，另配 1–2 道中高级 LeetCode/算法题；这些不是 Two Sum 或 Contains Duplicate 主线。

## 目录

1. [Week 1：概率、条件期望、联合分布、收敛与金融最低背景](#week-1)
2. [Week 2：统计推断、MLE、GLS、似然检验、bootstrap、正则化与研究数据](#week-2)
3. [Week 3：离散随机过程与 stopping-time 思维](#week-3)
4. [Week 4：连续随机过程、Itô calculus 与 Kalman filter](#week-4)
5. [Week 5：时间序列、协整、因子模型、波动率与最低限度组合风险](#week-5)
6. [Week 6：机器学习深度与严格时间序列验证](#week-6)
7. [Week 7：研究设计、multiple testing 与高效可复现代码](#week-7)
8. [Week 8：统计信号模型 vs ML 模型的高难度 capstone](#week-8)
9. [最终完成检查](#final-checklist)
10. [最终 scope](#scope)

## Week 1：概率、条件期望、联合分布、收敛与金融最低背景

**预算：10–12 小时。** 目标是从随机变量语言进入研究，而不是背金融术语。

### 阅读与观看
- `必做·阅读` 阅读 [Harvard STAT 110 课程教材页](https://stat110.hsites.harvard.edu/textbook) 中 conditional probability、expectation、variance、joint distributions 相关章节。
- `必做·观看` 观看 [MIT OCW 6.041 Lecture Videos](https://ocw.mit.edu/courses/6-041-probabilistic-systems-analysis-and-applied-probability-fall-2010/video_galleries/video-lectures/) 对应概率、条件概率和随机变量的讲次。
- `推荐·阅读` 对照 [MIT 6.041 Lecture Notes](https://ocw.mit.edu/courses/6-041-probabilistic-systems-analysis-and-applied-probability-fall-2010/pages/lecture-notes/) 的习题与证明。

### 主线与实现
- 推导 conditional expectation 的 tower property、independence 下的 factorization、joint/marginal/conditional density、covariance 与 total variance；说明 conditional expectation 是随机变量而不只是数字。
- 学习 almost sure、in probability、in distribution 的直觉，LLN/CLT 的条件与失败例子；用 simulation 比较 heavy-tail、dependent sample 与 iid 样本。
- 金融最低背景只包括 price/return、simple/log return、covariance、long/short、spread 和 benchmark；不展开债券、衍生品、完整投资管理或微观结构。
- 项目 1 起始：固定 seed，模拟 iid 与 dependent returns，输出联合散点图、条件均值、样本 covariance、收敛曲线和一页解释。

### 难题、面试与考核
- `中高级算法 1–2 题`：[LeetCode Monotonic Stack 题组](https://leetcode.com/tag/monotonic-stack/) 中选一题；另选 interval/line sweep 题，写 invariant、复杂度和边界证明。
- `理论/推导题`：证明 `Var(X)=E[Var(X|Y)]+Var(E[X|Y])`，构造一个不满足 iid 时样本均值不按 iid 直觉收敛的 simulation，并解释图形。
- `阶段考核`：提交 2–3 页 probability note、simulation notebook 和金融最低背景术语表；必须注明哪些结果来自定理、哪些只是有限样本观察。

## Week 2：统计推断、MLE、GLS、似然检验、bootstrap、正则化与研究数据

**预算：10–12 小时。** 目标是把概率模型转为可审计的统计研究。

### 阅读与观看
- `必做·阅读` 阅读 [An Introduction to Statistical Learning](https://www.statlearning.com/) 中 statistical learning、linear regression、resampling 和 regularization 相关章节。
- `必做·观看` 使用 [Stanford STATS 191](https://web.stanford.edu/class/stats191/) 的讲义/视频索引学习 likelihood、regression inference 和 bootstrap。
- `推荐·阅读` 阅读 [scikit-learn Linear Models](https://scikit-learn.org/stable/modules/linear_model.html) 对照实现，不把 API 输出当作证明。

### 主线与实现
- 推导 likelihood、score、Fisher information、MLE 的 asymptotic intuition；比较 OLS、MLE 与 GLS，说明异方差/相关误差下 GLS 的权重含义。
- 实现 likelihood-ratio test、Wald test、confidence interval、power simulation 和 nonparametric/bootstrap；记录 Type I error、multiple testing 的基本风险。
- 学习 ridge/lasso 的 bias-variance 取舍、正则化路径、特征标准化、缺失值、日期对齐、schema 和 look-ahead 防护。
- 项目 1：用研究数据做清洗 pipeline，比较 OLS/GLS/regularized model，报告系数不确定性、bootstrap 区间和残差诊断。Kaggle 实验 1 只允许用一个公开 tabular 数据集验证 pipeline，不以 leaderboard 为目标。

### 难题、面试与考核
- `中高级算法 1–2 题`：interval merge/interval query 题，以及 union-find 或 shortest path 题；给出数据结构不变量和复杂度。
- `理论/研究诊断题`：手推正态线性模型的 MLE 与 GLS 目标函数；模拟异方差数据，比较 naive standard error、robust/GLS/ bootstrap 结论，写出错误研究者会如何误读 p-value。
- `阶段考核`：交付可从原始数据重建的 clean pipeline、统计报告、power/coverage 表和一次 leakage audit。

## Week 3：离散随机过程与 stopping-time 思维

**预算：15–20 小时。** 目标是掌握离散随机过程的结构，而不是把 Markov chain 当作黑盒库。

### 阅读与观看
- `必做·阅读` 阅读 [MIT OCW 6.262 Discrete Stochastic Processes](https://ocw.mit.edu/courses/6-262-discrete-stochastic-processes-spring-2011/) 的 Markov chains、Poisson process 与 martingale 相关讲义。
- `必做·观看` 观看 [Harvard Stat 110 视频资源](https://stat110.hsites.harvard.edu/videos) 中 conditional expectation、Markov chain 和 martingale 相关讲次。
- `推荐·阅读` 阅读 [MIT 6.262 课程资料](https://ocw.mit.edu/courses/6-262-discrete-stochastic-processes-spring-2011/pages/lecture-notes/) 的习题。

### 主线与实现
- 离散 Markov chain：transition matrix、communicating classes、stationary distribution、detailed balance、mixing 直觉与 hitting time；用线性代数求 stationary distribution 并模拟收敛。
- Poisson process：inter-arrival、independent increments、thinning/superposition；比较离散计数与 Poisson approximation。
- conditional expectation、martingale、stopping time、optional stopping 的直觉；明确适用条件和“停止后仍可随意取期望”的错误。
- 项目 2 起始：实现 Markov chain hitting-time simulation 与 Poisson event simulator，和理论方程/Monte Carlo confidence interval 对照。

### 难题、面试与考核
- `中高级算法 1–2 题`：union-find 连接性题和 weighted graph shortest path 题；说明 amortized complexity 或 heap invariant。
- `理论/推导题`：求 gambler's ruin 的 hitting probability/expected time；证明一个简单 martingale，并判断给定 stopping time 是否满足可用的 optional-stopping 条件。
- `阶段考核`：提交 transition-matrix 推导、hitting-time 方程、Poisson simulation 和一份“定理条件 vs 实验结果”诊断报告。

## Week 4：连续随机过程、Itô calculus 与 Kalman filter

**预算：15–20 小时。** 目标是建立 applied mathematics 的深度边界：能推导和实现核心结果，但不声称完成测度论概率。

### 阅读与观看
- `必做·阅读` 阅读 [MIT OCW 18.S096 Topics in Mathematics with Applications in Finance](https://ocw.mit.edu/courses/18-s096-topics-in-mathematics-with-applications-in-finance-fall-2013/) 中 Brownian motion、Itô lemma 和 stochastic-process notes。
- `必做·观看` 观看 [NYU Courant Probability and Stochastic Processes](https://math.nyu.edu/degree-programs/graduate/ma-program/courses/) 中与 Brownian motion/Itô calculus 相关的公开课程资料。
- `推荐·阅读` 阅读 [Statsmodels statespace documentation](https://www.statsmodels.org/stable/statespace.html) 的 state-space/Kalman 实现说明。

### 主线与实现
- Brownian motion 的 increments、filtration 直觉、quadratic variation；用 partition simulation 观察 quadratic variation 收敛。
- 推导并应用 Itô lemma；Geometric Brownian Motion 只作例子，不作为金融课程主线。研究 Ornstein–Uhlenbeck process 的 mean reversion、stationary law 和 exact/discretized simulation。
- state-space model、hidden state、observation noise、prediction/update recursion 与 Kalman filter；比较 Kalman 与简单 rolling estimator。
- `选做·supporting note` 只做概念阅读：Radon–Nikodym、Girsanov、measure change、严格 stochastic-integral proofs；明确它们不属于两个月必修。
- 项目 2：用 OU 生成数据，分别用 naive、MLE/OLS 离散估计和 Kalman filter 恢复状态，报告参数 bias、预测区间和模型失配。

### 难题、面试与考核
- `中高级算法 1–2 题`：DP 题与 reservoir sampling/streaming top-k 题；说明状态定义、随机性不变量和空间复杂度。
- `理论/推导题`：计算 `d(X_t^2)` 或 `d f(t,X_t)` 的 Itô 展开；推导 OU 的 conditional mean/variance，并写出 Kalman 一步 update。
- `阶段考核`：交付手推笔记、quadratic-variation simulation、OU/Kalman notebook 和“GBM 只是例子、measure change 为选做”的边界说明。

## Week 5：时间序列、协整、因子模型、波动率与最低限度组合风险

**预算：15–20 小时。** 目标是把随机过程和统计模型连接到有限的研究语境。

### 阅读与观看
- `必做·阅读` 阅读 [Forecasting: Principles and Practice](https://otexts.com/fpp3/) 的 stationary time series、ARIMA 和 dynamic regression 章节。
- `必做·观看` 使用 [Columbia IEOR time-series course materials](https://www.columbia.edu/~mco2110/financialengineering.html) 定位 ARMA、cointegration 和 factor 相关讲义。
- `推荐·阅读` 阅读 [statsmodels Time Series Analysis](https://www.statsmodels.org/stable/tsa.html) 的实现文档。

### 主线与实现
- weak stationarity、autocovariance/ACF、ARMA/ARIMA、unit root、differencing、cointegration 与 error-correction intuition；区分相关、预测与因果。
- factor model、beta/exposure、横截面排序、rolling volatility；金融只保留 return、covariance、factor intuition、transaction cost 和 minimum risk metrics（volatility、Sharpe 假设、drawdown）。
- 实现一个可解释的时间序列/因子 baseline，严格按时间切分；记录调整、缺失、频率、样本区间和数据 provenance。
- 项目 1 收尾：输出模型假设、参数估计、残差/稳定性诊断和至少一个失败结果；不做债券、衍生品或完整 portfolio optimization。

### 难题、面试与考核
- `中高级算法 1–2 题`：randomized algorithm 题与 amortized-complexity 数据结构题，要求写期望复杂度或势能函数。
- `理论/研究诊断题`：证明/验证一个 AR(1) stationary condition；设计 spurious regression 与 cointegration simulation；诊断一个把 contemporaneous feature 偷渡进 label 的回测。
- `阶段考核`：提交时间序列研究 memo、协整/单位根诊断、因子暴露表、成本敏感性小表和 reproducible run。

## Week 6：机器学习深度与严格时间序列验证

**预算：15–20 小时。** 目标是学习可验证的 ML，而不是堆叠模型。

### 阅读与观看
- `必做·阅读` 阅读 [Stanford CS229 course materials](https://cs229.stanford.edu/) 与 [ISLP](https://www.statlearning.com/) 中 bias-variance、regularization、PCA、trees/boosting 和 model assessment 部分。
- `必做·观看` 观看 [MIT 6.036 Introduction to Machine Learning](https://openlearninglibrary.mit.edu/courses/course-v1:MITx+6.036+1T2019/about) 中 supervised learning、regularization 和 trees 讲次。
- `推荐·阅读` 阅读 [scikit-learn Cross-Validation](https://scikit-learn.org/stable/modules/cross_validation.html)、[Common Pitfalls](https://scikit-learn.org/stable/common_pitfalls.html) 和 probability calibration 文档。

### 主线与实现
- bias-variance、MLE connection、ridge/lasso、PCA、trees/random forest/boosting；理解 feature selection、scaling 和 missingness 对研究的影响。
- probability calibration、Brier/log loss、rank metrics；实现 nested time-series validation、rolling/expanding split、purged/embargoed CV，画出 label overlap 与 purge 区间。
- 建立 leakage diagnostics：fit transformer 只用训练期、冻结最终 test、检查 target construction、时间戳、feature availability 和 repeated tuning。
- 项目 3 起始：同一数据、同一 frozen test 比较统计 signal model 与 regularized/tree/boosting ML pipeline；只做一次有目的的 Kaggle 实验 2，研究 validation 与 leaderboard 差异，不追求排名。

### 难题、面试与考核
- `中高级算法 1–2 题`：hard/medium DP 题与 randomized streaming top-k/reservoir sampling 题，说明状态、随机不变量和复杂度。
- `理论/研究诊断题`：从 squared loss 推导 ridge solution 的 shrinkage；构造一个 calibration 很差但 accuracy 尚可的例子；给定事件标签窗口，画出正确的 purged/embargoed folds 并指出 leakage。
- `阶段考核`：提交模型比较表、nested validation 图、calibration curve、leakage audit 和 frozen-test 结论；明确“不优于 baseline”也是有效结果。

## Week 7：研究设计、multiple testing 与高效可复现代码

**预算：15–20 小时。** 目标是控制研究自由度，让结果经得起复核。

### 阅读与观看
- `必做·阅读` 阅读 [The Probability of Backtest Overfitting](https://www.pm-research.com/content/iijjpm/40/4/74) 的 multiple testing/selection 讨论。
- `必做·观看` 观看 [MIT OCW 6.172 Performance Engineering](https://ocw.mit.edu/courses/6-172-performance-engineering-of-software-systems-fall-2018/video-galleries/lecture-videos/) 的 profiling、benchmark 和性能讲次。
- `推荐·阅读` 阅读 [Python Packaging User Guide](https://packaging.python.org/en/latest/tutorials/packaging-projects/)、[pytest documentation](https://docs.pytest.org/en/stable/) 和 [Kaggle data leakage guidance](https://www.kaggle.com/docs/competitions/overview)。

### 主线与实现
- multiple testing、false discovery、selection bias、backtest overfitting、research registry、预注册假设、探索/确认分离；记录所有试验而非只记录最好结果。
- 设计成本敏感性：spread、commission、slippage、turnover 和执行时点；只报告 gross/net、最低风险指标与合理限制，不做投资建议。
- 将研究拆成 data/schema、features、models、validation、metrics、report；使用 tests、seed、configuration、logging、cache、profiling 和 vectorization。
- 项目 3：建立 `src/`、`tests/`、`data/README`、`experiment_registry.csv` 和命令行入口；至少五个测试覆盖切分、label、成本、指标和随机性。Kaggle 只复盘前面的实验 1–2，不新增周赛。

### 难题、面试与考核
- `中高级算法 1–2 题`：一道 amortized complexity/动态结构题和一道 shortest path/union-find 题；限时 45 分钟写出正确性证明。
- `研究诊断题`：给出 30 个候选信号、多个验证窗口和成本假设，设计 research registry、FDR/多重检验报告和 backtest-overfitting 审计；指出哪些自由度必须冻结。
- `阶段考核`：干净环境运行项目，生成 experiment registry、成本敏感性表、profiling 结果和一页 reproducibility audit；报告至少一个负面结论。

## Week 8：统计信号模型 vs ML 模型的高难度 capstone

**预算：15–20 小时。** 这是 2–3 个项目中的最终高质量作品，不是另起一个浅层 notebook。

### 阅读与观看
- `必做·阅读` 重读 [ISLP](https://www.statlearning.com/) 的 model assessment/regularization 章节，并复核 [scikit-learn model evaluation](https://scikit-learn.org/stable/modules/model_evaluation.html)。
- `必做·观看` 观看 [Dartmouth COSC 74 Machine Learning](https://www.cs.dartmouth.edu/~thc/courses/cs74/) 中与 generalization、model comparison 或 ensemble 相关的课程资料。
- `推荐·阅读` 参考 [Jane Street Research overview](https://www.janestreet.com/join-jane-street/overview/) 和 [Two Sigma careers](https://careers.twosigma.com/careers) 的研究岗位语言，只用于面试表达，不作为课程内容。

### Capstone 必做规格
- 提出一个可证伪研究问题，同时定义统计 signal model（例如带正则化/状态空间的可解释模型）和 ML model；写出数学假设、目标函数、可识别性或适用条件。
- 使用同一数据 provenance、同一预测 horizon、严格 walk-forward/nested/purged validation 和一次 frozen test；说明 feature availability、label overlap、embargo 与所有调参决策。
- 比较 baseline、统计模型和 ML 模型的预测/分类指标、probability calibration、return/risk、turnover、gross/net 与 transaction-cost sensitivity；不以最高收益作为唯一成功标准。
- 写 multiple-testing disclosure、研究 registry 摘要、失败实验、稳健性（时间区间/参数/成本/子样本至少两项）和限制；禁止把相关性写成因果。
- 交付可复现 repository、`README`、环境文件、测试、运行命令、数据说明、结果图和 1,500–2,500 字研究报告；报告结构为摘要、假设、推导、数据、方法、验证、结果、成本/风险、稳健性、限制、结论。

### 难题、面试与最终考核
- `中高级算法 1–2 题`：从 monotonic stack、interval、union-find/shortest path、DP、reservoir sampling、randomized algorithm、amortized complexity 中抽题，限时完成并口述 trade-off。
- `综合研究题`：30 分钟内解释为何选择统计模型和 ML 模型、如何证明没有 leakage、如何解读 calibration、multiple testing 和成本敏感性；另完成一道 conditional expectation/Markov/martingale 或 Itô/Kalman 推导。
- `阶段考核`：提交 capstone 报告、作品集 README、两条不夸大的简历 bullet、150 字口头摘要、三张面试图和 45 分钟 Quant Research 模拟面试。通过标准是别人能复现主要结论，且你能清楚说明数据不能证明什么。

## 最终完成检查

- [ ] 能推导并解释 conditional expectation、joint distribution、MLE/GLS、bootstrap、Markov chain、Poisson、martingale、stopping time、Brownian、Itô、OU、Kalman。
- [ ] 能解释 ARMA/cointegration/factor intuition、bias-variance、regularization、PCA、trees/boosting、calibration、nested/purged/embargoed CV 和 leakage。
- [ ] 两到三个项目均有数学推导、simulation、统计检验、严格时间序列验证、成本敏感性、测试和可复现报告。
- [ ] 完成一次有目的的 Kaggle pipeline/validation 实验和一次复盘实验，不把每周竞赛提交当作主线。
- [ ] 中高级算法题覆盖 monotonic stack/interval、union-find/shortest path、DP、reservoir/streaming、randomized algorithm、amortized complexity；没有 Two Sum/Contains Duplicate 必做主线。
- [ ] 能在模拟面试中区分证明、估计、预测、回测和金融解释的边界。

## 最终 scope

这仍是约两个月的高强度 Quant Research 实习准备路线，采用应用数学深度边界：核心随机过程和统计/ML 研究方法必须能推导、实现和诊断；测度论及严格随机积分理论仅作选做 supporting note。金融知识被有意压缩为 return、covariance、factor intuition、transaction cost、backtest bias 和最低风险指标，债券、衍生品、完整投资管理与微观结构课程已删除或降级。完成路线不等于完成完整数学金融课程、不保证实习，也不构成投资建议。
