使用说明与边界
这是一条面向 Quantitative Research 实习准备的深度优先、约两个月高强度路线,不是完整的数学金融课程,也不保证覆盖研究岗位所需的全部数学、统计、金融或软件工程内容。学习者假定具备微积分、线性代数、Python 和基础算法;概率统计基础有限,金融知识只作为研究语境。
- 时间预算:Week 1–2 每周 10–12 小时;Week 3–8 每周 15–20 小时。
- 两条主线:数学/概率理论与统计研究/机器学习。金融只保留 return、covariance、factor intuition、transaction cost、backtest bias 和最低风险指标。
- 应用数学边界:必修 Markov chain、Poisson process、conditional expectation、martingale、stopping time、Brownian motion、quadratic variation、Itô lemma、OU process、state-space/Kalman filter。测度论只作 supporting note;Radon–Nikodym、Girsanov、measure change 和严格随机积分证明列为选做。
- 项目策略:只做 2–3 个高质量项目;Kaggle 仅保留 2–3 个有明确研究目的的实验,不再每周强制提交。
- 问题难度:每周有理论/推导题或研究诊断题,另配 1–2 道中高级 LeetCode/算法题;这些不是 Two Sum 或 Contains Duplicate 主线。
目录
阅读、观看、实现、难题和阶段考核均计入每周时间预算;外链仅作资源入口,不对网站可访问性作验证。
Week 1:概率、条件期望、联合分布、收敛与金融最低背景
预算:10–12 小时。 从随机变量语言进入研究,而不是背金融术语。
阅读与观看
- 必做·阅读 阅读 Harvard STAT 110 课程教材页 中 conditional probability、expectation、variance、joint distributions。
- 必做·观看 观看 MIT OCW 6.041 Lecture Videos 对应讲次。
- 推荐·阅读 对照 MIT 6.041 Lecture Notes 习题。
主线与实现
- 推导 conditional expectation 的 tower property、joint/marginal/conditional density、covariance 与 total variance;说明 conditional expectation 是随机变量。
- 学习 almost sure、in probability、in distribution,LLN/CLT 条件与失败例子;simulation 比较 heavy-tail、dependent sample 与 iid。
- 金融最低背景只包括 price/return、simple/log return、covariance、long/short、spread 和 benchmark;不展开债券、衍生品、完整投资管理或微观结构。
- 项目 1 起始:固定 seed 模拟 iid 与 dependent returns,输出联合散点图、条件均值、sample covariance、收敛曲线和解释。
难题、面试与考核
- 中高级算法 1–2 题:LeetCode Monotonic Stack 题组选一题,再选 interval/line sweep 题,写 invariant、复杂度和边界证明。
- 理论/推导题:证明 total variance;构造非 iid 样本均值不按 iid 直觉收敛的 simulation。
- 阶段考核:2–3 页 probability note、simulation notebook 和金融最低背景术语表,区分定理与有限样本观察。
Week 2:统计推断、MLE、GLS、似然检验、bootstrap、正则化与研究数据
预算:10–12 小时。 把概率模型转为可审计的统计研究。
阅读与观看
- 必做·阅读 阅读 An Introduction to Statistical Learning 的 regression、resampling 和 regularization。
- 必做·观看 使用 Stanford STATS 191 讲义/视频索引学习 likelihood、regression inference 和 bootstrap。
- 推荐·阅读 对照 scikit-learn Linear Models 实现。
主线与实现
- 推导 likelihood、score、Fisher information、MLE asymptotic intuition;比较 OLS、MLE 与 GLS,解释异方差/相关误差下 GLS。
- 实现 likelihood-ratio test、Wald test、confidence interval、power simulation 和 nonparametric/bootstrap;记录 Type I error 与 multiple testing 风险。
- 学习 ridge/lasso 的 bias-variance 取舍、缺失值、日期对齐、schema 和 look-ahead 防护。
- 项目 1:研究数据清洗 pipeline,比较 OLS/GLS/regularized model,报告 bootstrap 区间和残差诊断。Kaggle 实验 1 仅用于一个 tabular pipeline 验证。
难题、面试与考核
- 中高级算法 1–2 题:interval merge/query 题,以及 union-find 或 shortest path 题,给出不变量和复杂度。
- 理论/研究诊断题:手推正态线性模型 MLE 与 GLS;模拟异方差并比较 standard error、GLS、bootstrap,解释 p-value 误读。
- 阶段考核:可重建 clean pipeline、统计报告、power/coverage 表和 leakage audit。
Week 3:离散随机过程与 stopping-time 思维
预算:15–20 小时。 掌握离散随机过程结构,而不是把 Markov chain 当黑盒。
阅读与观看
- 必做·阅读 阅读 MIT OCW 6.262 Discrete Stochastic Processes 的 Markov chains、Poisson process、martingale 讲义。
- 必做·观看 观看 Harvard Stat 110 视频资源 相关讲次。
- 推荐·阅读 阅读 MIT 6.262 课程资料 习题。
主线与实现
- Markov chain:transition matrix、communicating classes、stationary distribution、detailed balance、mixing、hitting time;用线性代数求 stationary distribution 并模拟。
- Poisson process:inter-arrival、independent increments、thinning/superposition;比较计数与 Poisson approximation。
- conditional expectation、martingale、stopping time、optional stopping 直觉与适用条件。
- 项目 2 起始:实现 Markov chain hitting-time 与 Poisson event simulator,对照理论方程和 Monte Carlo interval。
难题、面试与考核
- 中高级算法 1–2 题:union-find 连接性题和 weighted graph shortest path 题,说明 amortized complexity 或 heap invariant。
- 理论/推导题:求 gambler's ruin hitting probability/expected time;证明简单 martingale 并判断 stopping time 是否可用 optional stopping。
- 阶段考核:transition-matrix 推导、hitting-time 方程、Poisson simulation 和“定理条件 vs 实验结果”报告。
Week 4:连续随机过程、Itô calculus 与 Kalman filter
预算:15–20 小时。 能推导和实现核心结果,但不声称完成测度论概率。
阅读与观看
- 必做·阅读 阅读 MIT OCW 18.S096 Brownian motion、Itô lemma 和 stochastic-process notes。
- 必做·观看 使用 NYU Courant Probability and Stochastic Processes 相关课程资料。
- 推荐·阅读 阅读 Statsmodels statespace documentation。
主线与实现
- Brownian motion 的 increments、filtration 直觉、quadratic variation;用 partition simulation 观察收敛。
- 推导并应用 Itô lemma;Geometric Brownian Motion 只作例子。研究 Ornstein–Uhlenbeck 的 mean reversion、stationary law 和模拟。
- state-space、hidden state、observation noise、prediction/update recursion 与 Kalman filter;比较 Kalman 与 rolling estimator。
- 选做 supporting note:Radon–Nikodym、Girsanov、measure change、严格 stochastic-integral proofs,不属于两个月必修。
- 项目 2:用 OU 数据比较 naive、MLE/OLS 离散估计和 Kalman filter,报告 bias、预测区间和模型失配。
难题、面试与考核
- 中高级算法 1–2 题:DP 题与 reservoir sampling/streaming top-k 题,说明状态、随机性不变量和空间复杂度。
- 理论/推导题:计算 Itô 展开;推导 OU conditional mean/variance,并写出 Kalman 一步 update。
- 阶段考核:手推笔记、quadratic-variation simulation、OU/Kalman notebook 和应用数学边界说明。
Week 5:时间序列、协整、因子模型、波动率与最低限度组合风险
预算:15–20 小时。 把随机过程和统计模型连接到有限研究语境。
阅读与观看
- 必做·阅读 阅读 Forecasting: Principles and Practice stationary、ARIMA 和 dynamic regression。
- 必做·观看 使用 Columbia IEOR materials 定位 ARMA、cointegration 和 factor 讲义。
- 推荐·阅读 使用 statsmodels Time Series Analysis。
主线与实现
- weak stationarity、autocovariance/ACF、ARMA/ARIMA、unit root、differencing、cointegration 与 error-correction intuition;区分相关、预测与因果。
- factor model、beta/exposure、横截面排序、rolling volatility;金融只保留 return、covariance、factor intuition、transaction cost 和 volatility/Sharpe/drawdown。
- 实现可解释的时间序列/因子 baseline,严格按时间切分;记录数据 provenance。
- 项目 1 收尾:输出假设、参数、残差/稳定性诊断和失败结果;不做债券、衍生品或完整 portfolio optimization。
难题、面试与考核
- 中高级算法 1–2 题:randomized algorithm 与 amortized-complexity 数据结构题,写期望复杂度或势能函数。
- 理论/研究诊断题:验证 AR(1) stationary condition;设计 spurious regression/cointegration simulation;诊断偷渡 contemporaneous feature 的回测。
- 阶段考核:时间序列 memo、协整/单位根诊断、因子暴露表、成本敏感性和 reproducible run。
Week 6:机器学习深度与严格时间序列验证
预算:15–20 小时。 学习可验证的 ML,而不是堆叠模型。
阅读与观看
- 必做·阅读 阅读 Stanford CS229 与 ISLP 的 bias-variance、regularization、PCA、trees/boosting 和 assessment。
- 必做·观看 观看 MIT 6.036 supervised learning、regularization、trees。
- 推荐·阅读 阅读 Cross-Validation、Common Pitfalls 与 calibration 文档。
主线与实现
- bias-variance、MLE connection、ridge/lasso、PCA、trees/random forest/boosting;理解 feature selection、scaling、missingness。
- probability calibration、Brier/log loss、rank metrics;实现 nested time-series validation、rolling/expanding split、purged/embargoed CV,画 label overlap 与 purge 区间。
- 建立 leakage diagnostics:transformer 只用训练期、冻结 test、检查 label、时间戳、feature availability 和 repeated tuning。
- 项目 3 起始:同数据、同 frozen test 比较统计 signal model 与 regularized/tree/boosting ML;Kaggle 实验 2 只研究 validation 与 leaderboard 差异。
难题、面试与考核
- 中高级算法 1–2 题:hard/medium DP 与 randomized streaming top-k/reservoir sampling,说明状态、随机不变量和复杂度。
- 理论/研究诊断题:由 squared loss 推导 ridge shrinkage;构造 calibration 很差但 accuracy 尚可的例子;画正确 purged/embargoed folds。
- 阶段考核:模型比较表、nested validation 图、calibration curve、leakage audit 和 frozen-test 结论。
Week 7:研究设计、multiple testing 与高效可复现代码
预算:15–20 小时。 控制研究自由度,让结果经得起复核。
阅读与观看
- 必做·阅读 阅读 The Probability of Backtest Overfitting。
- 必做·观看 观看 MIT OCW 6.172 Performance Engineering。
- 推荐·阅读 阅读 Python Packaging User Guide、pytest 和 Kaggle guidance。
主线与实现
- multiple testing、false discovery、selection bias、backtest overfitting、research registry、预注册和探索/确认分离。
- 设计成本敏感性:spread、commission、slippage、turnover 和执行时点;只报告 gross/net、最低风险指标与限制。
- 拆分 data/schema、features、models、validation、metrics、report;使用 tests、seed、configuration、logging、cache、profiling 和 vectorization。
- 项目 3:建立
src/、tests/、data/README、experiment_registry.csv和命令行入口;至少五个测试。Kaggle 只复盘实验 1–2。
难题、面试与考核
- 中高级算法 1–2 题:amortized complexity/动态结构与 shortest path/union-find,限时 45 分钟写正确性证明。
- 研究诊断题:对 30 个候选信号设计 registry、FDR/多重检验报告和 backtest-overfitting 审计,冻结研究自由度。
- 阶段考核:干净环境运行项目,生成 registry、成本表、profiling 结果和 reproducibility audit,报告负面结论。
Week 8:统计信号模型 vs ML 模型的高难度 capstone
预算:15–20 小时。 这是 2–3 个项目中的最终高质量作品,不是浅层 notebook。
阅读与观看
- 必做·阅读 重读 ISLP assessment/regularization,并复核 scikit-learn model evaluation。
- 必做·观看 观看 Dartmouth COSC 74 Machine Learning generalization/ensemble 资料。
- 推荐·阅读 参考 Jane Street Research 与 Two Sigma careers 的岗位语言。
Capstone 必做规格
- 提出可证伪问题,同时定义统计 signal model 和 ML model;写出数学假设、目标函数、可识别性或适用条件。
- 使用同一 provenance、horizon、walk-forward/nested/purged validation 和 frozen test;说明 feature availability、label overlap、embargo 和调参决策。
- 比较 baseline、统计模型和 ML 的预测/分类指标、probability calibration、return/risk、turnover、gross/net 与 transaction-cost sensitivity。
- 写 multiple-testing disclosure、registry 摘要、失败实验、至少两项稳健性检查和限制;禁止把相关性写成因果。
- 交付 repository、README、环境文件、测试、运行命令、数据说明、图和 1,500–2,500 字报告,包含摘要、假设、推导、数据、方法、验证、结果、成本/风险、稳健性、限制、结论。
难题、面试与最终考核
- 中高级算法 1–2 题:从 monotonic stack、interval、union-find/shortest path、DP、reservoir sampling、randomized algorithm、amortized complexity 抽题,限时并口述 trade-off。
- 综合研究题:30 分钟解释模型选择、leakage、calibration、multiple testing、成本敏感性;另完成 conditional expectation/Markov/martingale 或 Itô/Kalman 推导。
- 阶段考核:提交报告、作品集 README、两条简历 bullet、150 字摘要、三张面试图和 45 分钟模拟面试;别人能复现主要结论,并能说明数据不能证明什么。
最终完成检查
- 能推导 conditional expectation、joint distribution、MLE/GLS、bootstrap、Markov chain、Poisson、martingale、stopping time、Brownian、Itô、OU、Kalman。
- 能解释 ARMA/cointegration/factor intuition、bias-variance、regularization、PCA、trees/boosting、calibration、nested/purged/embargoed CV 和 leakage。
- 2–3 个项目均有数学推导、simulation、统计检验、严格时间序列验证、成本敏感性、测试和可复现报告。
- 完成有目的的 Kaggle pipeline/validation 实验和复盘实验,不把每周竞赛提交当作主线。
- 中高级题覆盖 monotonic stack/interval、union-find/shortest path、DP、reservoir/streaming、randomized algorithm、amortized complexity;没有 Two Sum/Contains Duplicate 必做主线。
- 模拟面试中能区分证明、估计、预测、回测和金融解释的边界。
最终 scope
这仍是约两个月的高强度 Quant Research 实习准备路线,采用应用数学深度边界:核心随机过程和统计/ML 研究方法必须能推导、实现和诊断;测度论及严格随机积分理论仅作选做 supporting note。金融知识被有意压缩为 return、covariance、factor intuition、transaction cost、backtest bias 和最低风险指标,债券、衍生品、完整投资管理与微观结构课程已删除或降级。完成路线不等于完成完整数学金融课程、不保证实习,也不构成投资建议。