#041. 聚宽投资(JoinQuant)公开面经与题解
这不是公司介绍,而是一份只围绕“实际被问了什么、应该怎么答”的专项笔记。公开材料里最完整的是产品策略两轮题单;QR、量化策略与中台研究岗的题干更少,因此本文严格区分:明确原题、作者概括、基于公开考察范围的复习题。
聚宽 / JoinQuant题目优先
1. 来源地图与可信度
| 证据 | 岗位/年份 | 能确认什么 | 边界 |
|---|---|---|---|
| 小红书候选人原帖 | 产品策略,2024-12 | 两轮逐题题单;二面约 2 小时 | 非 QR,但量化产品情景题非常具体 |
| 小红书候选人原帖 | JQ 量化基金研究实习,2025-07 | 中台 FoF;模型评价、量化底层逻辑;一面不足 40 分钟 | 原帖没有逐字列题 |
| 小红书候选人+评论 | 量化策略,2025-09 | 一面简历/实习细节;有人遇到简单统计问题;后续 1–2 轮 | “简单统计题”无题干,不能伪造 |
| Glassdoor | QR Intern,2025-03 | 逐段深挖简历;明确一道优势题 | 样本只有 6 条公司记录 |
| Glassdoor | Quant Analyst Intern,2024-09 | “很多智力题和算法题” | 没有题干 |
| 雪球聚宽员工自述 | QR,2021 | 创始人交流 → 编程/数学/因子/ML/方向 → 因子云实习 | 公司自述,非匿名凉经 |
| 牛客散落进度帖 | Agent,2026 | 一面“纯聊天” | 无题目 |
| 一亩三分地 | Quant Finance Intern,2025 | 深挖简历中的 deep learning 项目 | 正文高积分隐藏 |
关键结论:牛客的聚宽企业页确实显示“面经 0 / 题库 0”,但这只说明帖子没有挂到企业标签,不等于全网没有聚宽面经。
2. 产品策略岗:一面 9 题逐题回答
以下均为候选人原帖明确列出的题目。
2.1 自我介绍
面试官实际在判断什么:你能否在 90 秒内建立“经历—岗位—证据”的闭环,而不是复述简历。
推荐结构:
- 一句话定位:专业背景 + 当前方向;
- 两段证据:一段量化/产品研究,一段数据分析或跨团队推进;
- 岗位映射:为什么这些能力能用于量化产品策略;
- 收尾:希望继续被追问哪个项目。
不要说“我学习能力强”。说“我在 X 周内把 Y 数据从不可用变成可用于 Z 决策,最后影响了什么指标”。
2.2 最有成就感的一段实习
用 目标—约束—判断—动作—量化结果—复盘 六段式。聚宽二面会持续追问,因此必须准备:你本人负责什么、基线是什么、失败尝试是什么、怎样排除替代解释。
若项目结果只写“提升 20%”,要能回答:分母是什么?离线还是线上?样本期多长?有没有选择偏差?
2.3 24 小时抗压课题如何分块完成
高分答案不是“熬夜做完”,而是展示受限时间下的最优资源配置:
- 先定义交付标准:必须回答的决策问题是什么;
- 把任务拆成数据、分析、判断、表达四条链;
- 找关键路径:哪些环节失败会让其余工作失效;
- 先做最低可行结论,再补稳健性和表达;
- 设置 4h / 12h / 20h 检查点并预留返工缓冲;
- 明确舍弃项及原因。
2.4 为什么没有留用成功
避免甩锅和自我否定。推荐格式:事实 → 可控/不可控拆分 → 我得到的反馈 → 已验证的改进。如果是 HC 或毕业时间问题,仍要说明你从业务反馈里学到了什么;如果是能力缺口,必须给出之后的行为证据。
2.5 如何复用股票行研研究指数增强产品
这是产品岗里最有“量化味”的一道。
第一步:从单股观点转成可批量验证的信号。 把行业景气、盈利质量、估值、分析师预期修正等行研逻辑定义成全市场统一口径的特征,保证当时可得,避免使用财报后来修订值。
第二步:评价信号。 看截面 RankIC、ICIR、分组收益、衰减、换手、行业/风格中性化前后表现;不能只展示累计收益曲线。
第三步:进入组合。 目标是相对基准最大化预期超额收益,同时约束行业、风格、个股权重、换手、流动性与交易成本:
$$\max_w; \alpha^\top w-\lambda w^\top\Sigma w-c(w-w_{t-1})$$
其中 $\alpha$ 是预测超额收益,$\Sigma$ 是风险模型,$c$ 是换手/冲击成本。
第四步:产品语言。 说明跟踪误差、超额回撤、容量和不同市场环境下的失效方式。产品策略不是“讲出一个好因子”,而是解释这套信号如何形成可销售、可持有的风险收益特征。
2.6 如何判断核心产品或补充产品线
不要按规模拍脑袋。可用六维评分:
| 维度 | 核心问题 |
|---|---|
| 客户需求 | 是否覆盖稳定、广泛、可长期持有的需求 |
| Alpha 可持续性 | 信号是否有机制解释、容量是否足够 |
| 组合角色 | 能否成为客户组合底仓,还是只在特定环境有用 |
| 运营复杂度 | 申赎、估值、合规、交易是否稳定 |
| 商业可扩展性 | 费率、渠道、规模增长是否与业绩冲突 |
| 与现有产品相关性 | 是真正补充,还是换名字重复暴露 |
核心产品通常具备稳定需求、清晰基准、较大容量和可重复交付;补充产品可接受窄容量或情景依赖,但必须提供低相关收益或解决特殊需求。
2.7 举一个数据分析能力的例子
必须讲清四个对象:决策对象、数据口径、识别方法、行动结果。相关性分析不等于因果识别;如果没有 A/B 条件,要诚实说明用了前后对照、匹配、分层或稳健性检查中的哪一种。
2.8 如果重来,会提升哪些方面
选一个真实但不致命的缺口,说明它如何影响结果,再给出已经执行的改变。高分点是“知道当时为什么没看见这个问题”,而不只是“以后更细心”。
2.9 未来职业规划
围绕能力复利而不是职位头衔:短期能独立完成产品研究闭环;中期理解策略、组合与客户三端;长期能把复杂投研结果翻译为真实配置决策。避免承诺“几年成为基金经理”这种不可控结果。
3. 产品策略岗:合伙人二面 7 组题
3.1 介绍工作内容:60% 专业 + 40% 沟通管理
面试官在校验你是否会准确归因个人贡献。回答时把工作按“研究生产”和“组织传输”分开:前者是数据/模型/结论,后者是需求澄清、资源协调、风险同步和结论表达。
3.2 如何做到快速交易
先反问“快”指低决策延迟、低下单延迟,还是在限定时间内完成大单。完整答案应覆盖:
- 信号生成与风控计算增量化,减少全量重算;
- 行情、策略、订单链路异步化,关键路径内存化;
- 订单拆分与交易场所/券商路由;
- 预交易风控不能为了速度被删掉;
- 用端到端 p50/p99 延迟、成交率、滑点和拒单率共同评价。
3.3 指增产品大量买卖有什么风险
至少分四类:
- 市场冲击:自己的订单推动价格,成交均价恶化;
- 流动性与无法成交:小盘股、涨跌停、停牌导致目标仓位无法实现;
- 跟踪误差:换仓过程中暴露偏离基准;
- 信号衰减与拥挤:执行越慢,预测收益越可能被成本吃掉。
量级思维:冲击成本常随参与率、波动率和订单相对日均成交量增大;不能只说“有滑点”。
3.4 先买后卖还是先卖后买,为什么
没有固定答案,应写成约束优化:
- 先卖后买:降低融资/资金占用和总敞口,但可能暂时低仓位、错过上涨;
- 先买后卖:保持仓位和基准暴露,但需要现金/融资,会短暂放大总敞口;
- 实际顺序取决于现金、冲击成本、个股流动性、涨跌停概率、基准偏离与信号紧迫度。
成熟答案是分批交错执行,把“顺序”变成实时调度问题,而不是二选一口号。
3.5 如何换仓、如何选择买卖股票
先算目标持仓与当前持仓差 $\Delta w=w^*-w_{t-1}$,再按预期收益损失、风险偏离、流动性和交易成本排序。常用思想:只有当边际预期收益超过边际成本和风险惩罚时才交易。对涨跌停、停牌和成交量不足的股票设硬约束;对其余股票使用参与率和时间窗控制。
3.6 路演一家公司
用八分钟版本:公司如何赚钱 → 行业结构 → 三个关键经营驱动 → 市场定价隐含了什么 → 你的分歧 → 催化剂 → 下行风险 → 估值区间。不要把公司介绍当投资建议,必须明确“当前价格需要什么假设才合理”。
3.7 向 50 岁散户推销一只股票
这题不该“硬推”。先做适当性询问:资金用途、期限、可承受回撤、已有资产、是否理解单股风险。然后用非技术语言解释商业模式、主要风险和仓位上限;主动提出“不适合购买”的条件,反而体现职业边界。
3.8 你如何说服别人
结构:分歧是什么 → 对方真正的目标/顾虑 → 哪条共同事实可以验证 → 设计低成本试验 → 对方如何改变决策。说服不是压过对方,而是降低不确定性和行动成本。
4. QR / 量化策略 / 中台:已确认的考法
4.1 QR Intern:你的优势是什么,在哪些任务中体现
这是 Glassdoor 唯一逐字可见的 QR 问题。回答要把“优势”写成可观察行为:例如“我擅长把模糊研究问题变成可证伪实验”,证据是如何定义基线、控制泄漏、发现坏 case、推翻最初假设。只说聪明、认真、抗压都不可验证。
4.2 简历逐段深挖:准备一张项目审讯表
公开 QR 和量化策略面经反复出现简历/项目深挖。每个项目至少准备:
- 研究假设与经济机制;
- 标签如何构造,何时可得;
- 样本如何切分,怎样防止前视与重叠泄漏;
- 为什么选这个模型,最强基线是什么;
- IC、收益、换手、回撤、容量怎样互相验证;
- 失败 case 和 regime shift;
- 从回测到实盘会损失什么;
- 你本人改了什么,若重做先改哪里。
4.3 “模型怎么评价”应如何答
JQ 中台 FoF 原帖明确说被问到深层模型评价与量化底层逻辑,但没有公开题干。可按三层回答:
- 预测层:loss、RankIC/ICIR、稳定性、校准;
- 策略层:净收益、Sharpe、最大回撤、换手、容量、不同市场分段;
- 决策层:模型增量是否在控制风险和成本后仍存在,是否与现有模型低相关。
最常见错误是离线 MSE 更低就宣布模型更好。量化目标还受到排序、持仓约束、交易成本和时变分布影响。
4.4 简单统计题:只知道类别,不知道原题
量化策略岗评论只说“很简单的统计问题”。因此这里不能写成聚宽原题。最低准备集合:条件概率、期望/方差、协方差与相关、正态分布、抽样误差、OLS 假设、过拟合与多重检验。
5. 编程 / 数学 / 因子云实习:公开范围与应答模板
聚宽员工自述确认专业面考察编程和数学基础、因子研究、机器学习与个人研究方向;之后用典型因子研究项目做云实习。以下是范围复习题,不是泄露原题。
5.1 因子研究从零到结论
回答顺序:经济直觉 → 原始字段当时可得性 → 清洗/去极值/标准化 → 行业市值中性化 → IC 和分组 → 换手与成本 → 风险暴露 → 样本外/滚动验证 → 与现有信号相关性 → 容量与上线监控。
5.2 为什么随机切分不适合金融时间序列
随机切分会把未来 regime、相邻重叠标签或同一事件的信息泄露到训练集。应按时间 walk-forward;若标签跨越未来窗口,训练/验证边界使用 purge,调参评估之间用 embargo。
5.3 回测很好、实盘变差的排查顺序
先查数据与时间戳,再查成交建模,再查成本和容量,最后才怀疑模型本身:
- 前视、幸存者、复权、财报发布日期;
- 信号生成与订单到达时间;
- 涨跌停/停牌/成交量限制;
- 手续费、冲击、排队与部分成交;
- 因子拥挤、市场状态变化;
- 代码版本和线上特征口径漂移。
6. 一小时模拟面试脚本
| 时间 | 内容 | 验收标准 |
|---|---|---|
| 0–8 min | 自我介绍 + 最强项目 | 90 秒定位;项目可被连续追问 |
| 8–25 min | 项目审讯 | 数据时点、标签、切分、成本、失败例完整 |
| 25–38 min | 指增换仓情景 | 风险、执行顺序、优化目标、硬约束齐全 |
| 38–48 min | 因子/模型评价 | 预测层、策略层、决策层三层分开 |
| 48–56 min | 概率/算法 | 写清样本空间或复杂度,不只报答案 |
| 56–60 min | 反问 | 研究流程、反馈周期、实习评价标准 |
7. 易错边界
- 把“聚宽平台教程”当成“聚宽投资面试题”。
- 把招聘机构写的模板题当候选人回忆原题。
- 产品题只谈金融名词,不把目标、约束、权衡说清。
- QR 项目只报 Sharpe,不解释时点、成本、容量和失效期。
- 不知道具体统计题时,擅自编一道并写成“聚宽原题”。
8. 证据索引
- 产品策略候选人原帖(小红书)
- JQ 量化基金研究岗原帖(小红书)
- 量化策略岗位讨论(小红书)
- JoinQuant interview records(Glassdoor)
- 聚宽员工 QR 面试与云实习自述(雪球)
- 一亩三分地 JoinQuant Quant Finance Intern 摘要
- 牛客聚宽企业题库页:0 条
9. 我的判断
聚宽公开题目的核心并不是某一道神秘概率题,而是连续追问下的研究闭环:你能否把一个想法变成无泄漏的数据实验,再把预测转换成受风险、成本和执行约束的组合决策。产品策略二面的“先买后卖还是先卖后买”正是缩小版:没有脱离约束的标准答案,面试官看的是你会不会先定义目标、枚举风险、量化权衡并在新条件下更新答案。
10. 聚宽逐题深答:用案例把原来的框架展开
本节沿用原页的一面、二面和QR主题。以下人物、任务与数字均为教学假设,帮助学习推理结构;不能作为个人经历直接背诵,也不是公司标准答案。
10.1 自我介绍:怎样从履历走到岗位证据
先用一句话定位目前的研究能力,再挑一段最接近岗位的经历,而不是从高中讲起。顺序为“研究问题→我的工作→验证结果→仍未解决的限制→为何匹配”。例如“我研究文本事件识别,负责数据时间戳清理与模型训练,用按时间留出的测试期验证,发现收益主要来自减少误报而非更复杂模型”。接着准备面试官追问每个名词的证据。没有金融项目就明确用相关研究证明迁移能力,不能换个名词宣称已有交易经验。
10.2 最有成就感的实习:成果如何归因
写出原先问题、约束和baseline;再解释你做的关键判断。例如数据流程每天失败,不要只说“优化系统”,应说发现日期口径不一致→统一事件时间→补幂等与重放→用同一批输入比较漏数与延迟。量化前后指标时需相同样本与时间窗;团队上线成果中,个人负责哪段要清楚。最后说明如果撤掉你的改动,问题是否重新出现,这比泛称“提升效率”有说服力。
10.3 24小时课题:按不确定性安排工作
教学分配:前2小时明确问题和数据可得性,接着4小时完成最小可运行基线,中间8小时验证最关键假设,接着6小时做稳健性与错误分析,最后4小时整理结果和复现说明。数据不可得时立刻缩小到可检验代理问题,不能18小时后才说没数据。可交付包括假设、方法、图表、限制,不把“跑完模型”当完成。必须给中途检查点:基线不能运行时先保住可靠的描述统计。
10.4 为什么没留用:事实与改进分开
先陈述已知事实:项目结束、编制变化或具体反馈;未知原因就说未获得明确反馈。若问题在自己,给可观察行为与改进:“需求确认晚,做了不需要的分析;此后先写一页验收标准并在半程确认”。不要推测面试官动机,也不要把所有失败归环境。结尾给改进在后来任务中的真实验证,没验证就说正在做。
10.5 行研如何复用到指数增强
把主观判断拆为可在当时观测的变量。例如“库存压力缓解”转成库存周转、价格变化、订单信息,明确披露滞后和可交易日;验证对未来收益的横截面预测,控制行业、规模、估值等已有暴露。然后放入受跟踪误差、行业权重、换手限制的组合,不是看到公司好就大幅超配。若超额只来自行业上涨,应承认并未证明选股alpha。
10.6 核心产品还是补充产品线
先看服务哪类客户需求、与现有产品的收益相关性、容量、流动性、费用及团队可持续交付。一个高收益小容量策略可以是补充,不能只按历史Sharpe评核心。教学比较:A规模稳定、客户需求明确、收益来源可解释;B回测突出但样本短且容量有限,先小规模验证B更合理。判断需客户/产品事实,不能凭名称给结论。
10.7 数据分析例子:从异常到结论
按“问题→口径→假设→验证→行动”组织。例策略收益突然下降,先核实复权、交易日、费用是否变动,再按行业/波动/时段拆分,定位损失集中在哪些切片;用同期对照和时间留出检验,避免只选最差时段讲故事。修复后重跑相同输入,报告哪些变化来自数据校正,哪些是真正模型改进。
10.8 重做会改什么
挑一个会改变结果的决定而不是“多读论文”。例如原来随机切分导致泄漏,重做先按时间分割并记录每项特征的可见时点,再训练baseline,最后才调模型。解释代价:离线分数可能变差,但能更准确估计部署表现。用新的实验或反例说明这是复盘后的认知变化,而非泛泛自我批评。
10.9 职业规划
从希望持续解决的问题谈起,再说明当前能力缺口和岗位能提供的反馈。例如偏研究者希望把统计假设做到可证伪、可复现并与真实业务反馈对齐;偏工程者希望构建可靠的数据/交易系统。给可验证的近期学习目标,如独立完成一份带成本的时间序列研究,避免无依据的职级和收益承诺。
10.10 专业与沟通如何分配
“60%专业+40%沟通”是旧面经描述,不是固定定律。专业部分负责事实和分析,沟通负责让输入、决策与责任一致。教学场景:研究员给出新因子,产品经理需把回撤、容量和适用市场讲清,不能只转述收益图。遇到分歧先对齐指标和样本,再区分事实分歧与风险偏好差异,保留决策记录。
10.11 如何快速交易
先问“快”是收到信号到下单的低延迟,还是大额换仓尽快完成。前者分解行情接收→特征计算→策略→风控→网关各段延迟,盯P99和抖动;后者存在冲击与机会成本权衡,不能越快越好。预计算和减少复制可能优化前者,分片与参与率控制可能优化后者;成交速度还受对手流动性影响,不是系统发单快就保证成交快。
10.12 大额买卖风险怎样量化
分市场暴露变化、流动性冲击、成交不确定性和操作风险。教学例:日均量10万股的股票想换5万股,交易量占比较高,历史按中价成交的回测会失真。先看盘口深度和参与率,估滑点压力情景,再设价格/数量/总敞口限制。报告风险来源和监测条件,不能仅列“有流动性风险”六个字。
10.13 先买后卖还是先卖后买
先写约束:现金、融资能力、总/净敞口、市场方向风险和可成交性。先买可减少踏空但增加现金需求和暂时超配;先卖腾现金但产生暂时低仓位。教学例卖出100万、买入100万,若先买且无现金/融资则不可行;若卖出标的不流动,买完卖不掉会留下额外敞口。可按行业或风险敞口成对小批换仓,逐步匹配成交,不存在无条件的统一答案。
10.14 换仓与选股怎样统一
对候选新组合w最小化偏离目标加成本,或最大化$\alpha^Tw-\lambda w^T\Sigma w-\eta\|w-w_0\|_1$,同时满足预算、行业、单名和流动性约束。先解释三项:预期收益、风险、换手成本。若信号优势小于交易费用就不换,形成no-trade区域。预测分数不是直接仓位,必须经过组合约束和执行。
10.15 路演一家公司怎样讲
依次说明公司靠什么赚钱、行业供需、竞争位置、关键财务驱动,再给估值情景和反证。教学DCF:$V=\sum_{t=1}^T FCF_t/(1+r)^t+TV/(1+r)^T$,解释增长与折现率假设如何影响价值;不能把单点估值包装成确定价格。最后说出哪些新证据会推翻判断,表明你在做研究而不是推销故事。
10.16 向50岁客户介绍股票
年龄本身不能确定风险承受力。先了解资金用途、期限、可承受亏损、既有资产和理解程度,再用通俗语言解释收益来自什么以及可能损失;如果需要保本或近期用款,就不应强推股票。面试重点是把复杂风险准确说清和识别不适配,而不是靠话术促成成交。本节是沟通训练,不指定证券或投资操作。
10.17 如何说服别人
选一次有合理反对意见的例子:对方担心什么、你拿出什么新证据、如何设计低成本试验、最后是否改变了决定。例如同事担心新模型延迟超预算,先做固定流量A/B离线压测,再决定是否灰度。若对方因风险偏好仍不同意,不等于说服失败;共同明确条件性决策比强行达成表面一致更重要。
10.18 优势如何具体证明
从岗位任务反推优势,例如“能把模糊问题转成可检验实验”。用两段不同场景证据证明可迁移,再主动说边界:擅长数据与训练不意味着懂低延迟C++。面试官能追问到输入、方法、失败和结果的证据,比“学习能力强、抗压能力强”可信。
10.19 模型怎么评价:预测到净收益的完整链
先看任务:回归有MSE/MAE,分类有PR/ROC和校准,排序有IC/RankIC。然后看统计稳定性:按时间/行业/波动切片,报告置信区间与多重尝试。再看策略:分组单调、成本后收益、波动、回撤、容量及暴露。高AUC可能来自大量不可交易的小变动;高IC也可能被成本吃掉。指标须与决策目标一致,不能挑最好看的一个。
11. 国内 QR 八问:公式与研究操作一起解释
11.1 Alpha为什么可能持续,跨市场为何不同
提出机制假设,如信息吸收延迟、风险补偿或行为偏差;分别给可区分预测。若是信息延迟,改善信息渠道后效应应减弱;若是风险补偿,危机阶段可能出现系统性损失。跨市场差异可能来自披露制度、投资者结构、交易成本、样本口径、拥挤度,先统一定义和信息时点再比较。不能从一张收益曲线倒推唯一机制。
11.2 预测目标与PnL是否一致
模型预测明日收盘对今天收盘收益,但实际要等今天收盘后才得到特征,则今天收盘买入不可执行。将标签改成可成交时刻到退出时刻的收益,并扣成本。若最终做横截面中性组合,训练原始涨跌可能主要学市场方向;可比较残差收益或排序目标,但所有中性化参数只能用当时可用数据估计。
11.3 数据口径怎样排前视
逐字段记录event_time、publish_time、ingest_time、decision_time,要求feature available_time≤decision_time。股票池包含退市与历史成分,财务按当时披露版本,复权使用方式与目标一致。涨跌停或停牌时不能假设任意成交。最直接自测:把特征整体晚一天仍异常好,或把未来字段加入后几乎不增分,都值得查泄漏,但不单靠此判定。
11.4 Walk-forward、purge、embargo
沿时间训练过去、验证随后,再向前滚动。若标签覆盖[t,t+5],训练末端标签跨进验证期时删除重叠样本,称purge;embargo在边界留额外隔离以减少信息相关泄漏。边界按标签实际覆盖时间决定,不能机械写“留1%”。最终测试只使用一次,反复看测试调参就把它变成验证集。
11.5 IC、IR、分组、换手、回撤如何互证
截面IC是当日因子与未来收益相关;RankIC先排名。时间上的平均IC/IC标准差通常称ICIR,和策略收益的Information Ratio不同,年化还依赖频率与相关性。分组收益应看是否单调且是否仅极小盘驱动,换手衡量组合变化,最大回撤衡量路径损失。只有IC稳定、收益能实现且成本可承受,证据链才完整。
11.6 坏case怎样定位
固定失败定义,如成本后日收益低于阈值、模型方向错误或执行滑点异常;分数据、预测、组合、执行四层排查。保存当时输入、模型版本、目标订单与实际成交,重放同样数据定位首次偏离。若仅在高波动期失败,再区分标签不稳定、敞口放大和流动性消失,不能一律通过加训练数据解决。
11.7 回测到实盘需要什么折扣
无需拍一个固定“打五折”。分别压力测试费用、滑点、成交率、信号延迟、容量和借券等约束,对每项给敏感性曲线;然后用纸面跟踪或小规模受控验证看假设是否成立。实盘净收益比回测差可分预测衰减与执行差异,两者责任和修复方法不同。
11.8 下一步先改哪层
按错误贡献和可验证性排序:口径错先修数据,目标不可交易先修标签,预测有增量但收益差先看组合/执行,只有表示能力不足才上复杂模型。用一次只改变一个主要因素的对照保留归因;如果同时换数据、模型和成本假设,漂亮曲线不能说明是哪一项有效。
11.9 多重共线性、IC几何与复制样本
带截距回归残差与设计列正交;中心化后的IC等于两个向量夹角的余弦。列近线性相关使XᵀX条件数大,系数对微扰敏感但预测未必同样差,可用QR/SVD诊断、Ridge稳定或删冗余特征。
把全部样本复制一遍,OLS最优系数不变,因为损失整体乘2;但复制行不创造独立信息,若错误按2n独立样本估标准误,会虚假提高显著性。增加新独立样本、删除异常样本和复制样本是三种不同操作。
11.10 集成、标准化、平稳性
Bagging对不同重采样模型平均主要降方差;Boosting逐步拟合损失梯度;Stacking以基模型预测为输入训练元模型,必须用out-of-fold且遵守时间顺序,不能用训练内预测训练元层。若各模型在不同市场状态有效,可学门控,但状态只能来自当时信息。
标准化(x−μ)/σ和min-max归一化(x−min)/(max−min)不是一回事,都只在训练集拟合参数;异常值会强烈影响min/max。弱平稳要求均值常数、协方差只依赖滞后;ACF看直接相关,PACF看控制中间滞后后的相关。价格非平稳不意味着收益一定平稳,需要切片和统计检验。
11.11 协整、冲击与久期中性
Engle–Granger先对两条可能I(1)价格序列回归y=a+βx,检验残差是否平稳;残差单位根检验要用对应临界值,不是普通回归t检验。只有相关高不等于协整。交易信号可用训练窗估残差z-score,阈值、再估计、费用及结构断裂都需样本外检验。
大单一次成交冲击大,切片降低瞬时参与率却延长价格风险暴露;设总目标为预期冲击+风险惩罚,最优速度由风险厌恶和流动性共同决定。
债券价值V、修正久期D,小利率变动Δy导致价值变化约−VDΔy。持有债A,卖出债B名义价值h,则久期中性条件$V_AD_A-hD_B=0$,得$h=V_AD_A/D_B$。它只对小幅平行利率移动一阶中性,仍有凸性与曲线形状风险。