离开数据血缘管理谈合规留存,就像没有目录的档案室监管要找一份数据,你翻遍所有存储也未必交得出来,量化机构的数据合规,根基正是把每条数据的来源、流向和生命周期记录清楚。
数据血缘是量化合规留存的“生命线”
没有血缘关系的数据,留存得再多也是死数据
量化研究里,因子库、行情库、交易记录散落在不同服务器上,今天跑出一个信号,明天发现数据口径不对,你改完源头,下游所有衍生指标跟着变了,这时候如果没有一份完整的血缘图谱,你根本说不清哪些结果受影响,哪些报告需要撤回。
数据血缘像一张家谱,记录着每个数据字段从哪里来、经过哪些加工、被谁用过,做合规留存,留的不只是原始文件,更是这套加工履历,监管来查的时候,你得能回答三个问题:这笔数据最初是谁采的?中间改过几次?最终用在了哪个策略上?
从监管视角看,血缘记录就是自证清白的证据链
近年来的监管趋势是把穿透式审查落实到数据层面,据证监会公开信息,针对程序化交易的监管框架逐步完善,对交易留痕、日志保存、异常交易回溯都有明确要求,行业共识认为,没有血缘关系的数据留存,在监管眼里等同于数据缺失因为无法验证数据真实性,也无法还原业务全貌。
一个实际场景:交易所问询某只股票异动,你的风控系统显示交易信号来自某个因子,但这个因子的底层数据是三个月前接入的第三方舆情,中途做过多轮清洗加工,要把这条链路完整讲清楚,靠的是逐层记录的数据血缘,而不是事后从回收站里翻文件。
解读数据合规留存要求:量化机构该留什么、留多久
数据分类分级是留存策略的第一步
数据合规留存最忌讳一刀切,有的机构为了保险,把所有数据都存十年,成本暴涨;有的机构怕麻烦,统一存两年,结果监管要求三年期限,直接违规。
合理的做法是先把数据分成三档:
- 交易类数据:订单、成交、撤单记录,这类数据监管要求最严,留存周期通常较长
- 研究类数据:因子计算中间层、回测结果、策略参数,属于机构核心资产,按内部制度留存
- 基础行情数据

:原始行情、财务快照、舆情数据,取决于采购合同约定和业务必要性
分类分级不是财务部门的事,需要量化研究员、IT运维、风控合规三方坐下来一起定。很多机构卡在这一步,是因为没人说得清数据资产里到底有什么。
数据血缘管理怎么做才能满足合规留存要求
第一步,给每个数据集登记出生证明,也就是采集来源、采集时间、采集方式,第二步,记录每次加工过程,包括清洗规则、字段变更、责任人,第三步,标注使用场景,比如用于策略回测、组合优化还是风控监测。
听起来复杂,但落到工具层面就是三张表的联动:元数据表(长什么样)、血缘关系表(怎么来的)、访问日志表(谁用过),业内专家指出,量化机构数据合规整改方案的核心,就是把这三张表对齐全,做到任何一个字段都能一键溯源。
这活儿拖不得,数据量越大,补建血缘的成本越高,今天是十亿行因子数据,一年后是一百亿行,到时候想追根溯源,连老员工都走了一半,历史加工逻辑早就失传了。
数据血缘管理在量化研究场景中的三种典型用途
回测可追溯:让策略报告经得起推敲
策略研究员在晨会上展示一个年化超基准的模型,领导第一反应不是夸,而是问:这个因子的数据是哪来的?用了幸存者偏差的股票池吗?做过前视偏差处理吗?
有血缘记录的系统,点开因子节点就能看到完整加工路径,写策略报告的时候,把一个快照链接附在附录里,比口头解释一百遍都有说服力。这既是对研究质量的把控,也是机构在后续做业绩归因时的底气。
归因分析:从结果到原因的导航地图
当实盘业绩跑输基准,基金经理要拆解是行业配置的问题、个股选择的问题还是交易执行的损耗,每一步归因都要引用数据,而每份数据都覆盖了不同的时间窗口、不同的清洗规则、不同的复权方式。
血缘图谱能帮你在半小时内找到问题源头:哦,原来是分红除权那天的复权因子用错了版本,导致收益计算偏差,没有血缘管理,这种细微数据问题可能要折腾团队一两周。
争议排查:客户问询和监管质询的底气
客户觉得净值核算有问题,监管觉得交易频率异常,合作方觉得共享数据被挪作他用,这些场景下,你得拿出证据链自证清白,一份清晰的血缘记录让数据的使用边界和演变过程一目了然。

直白地说,量化机构处理数据争议的底牌,就是血缘分图谱上那一条条记录,任何阶段的任何变更都留痕,比事后拼凑邮件截图强得多。
量化研究数据留存几年?算好期限这笔账
不同数据类型对应不同留存周期
行业普遍做法是分档处理,交易委托及成交记录,多数机构按照法规要求留存二十年甚至更长;策略研究相关数据和中间产物,一般留存五到十年,符合内部质量管理和知识产权保护需求;原始行情数据,常见做法是存三到五年,因为这类数据可以复购,长期存储性价比不高。
合规的要求不是让你无限期保存数据,而是让你在需要的时候拿得出来。所以数据血缘管理的另一核心功能,是帮合规部门筛出该删的数据到了期限就自动标记,进入删除流程,既降低存储成本,也减少数据暴露面。
过了留存期的数据该怎么“善终”
很多机构只关心“存不存”,不关心“怎么销”,数据销毁不是点个删除键就完事,需要分级分类处理:普通加工数据源覆盖写,核心策略参数要物理销毁存储介质,云上的数据还要确保备份副本同步清除。
这个过程中的每一步也要留痕,形成一份销毁审计日志,别小看这一步,数据没删干净,将来监管检查旧账的时候,过期数据还在线上,那可比没留存更麻烦。数据血缘管理管的是数据的全生命周期,删除是最后一段旅程,同样要走得堂堂正正。
实操落地:数据血缘管理系统怎么搭
从存量数据盘点开始,别一上来就上工具
先把散落各处的数据资产摸清楚:MySQL里存了哪些表?Parquet文件落在哪个仓库?量化终端上的因子计算脚本在谁手里?逐一登记,建一份数据资产目录,这份目录就是后续所有血缘关系的基础。
注意这里的核心方法是:先建立数据地图,再标注数据关系,最后才能实现动态追踪,跳步走很容易搞出一堆没人维护的数据字典,沦为空摆设。
给每个数据字段打上“身份标签”
标签包括业务含义、质量等级、敏感级别、负责人、创建日期,每张表、每个关键字段都打上,就像给档案贴了索引号,之后任何数据流转、加工、输出,系统自动记录上下游关系。

实际操作路径:
- 离线数仓场景:用调度系统记录的依赖关系自动生成血缘
- 实时流场景:在消息队列层面的消费者逻辑里埋点,记录数据流向
- 机器学习建模场景:为训练集和特征集的关键版本生成不可变标识
选型数据血缘工具时该对比什么
市面上一堆数据治理平台都在讲血缘,但侧重不同,有的擅长自动解析SQL,有的擅长可视化展示,有的偏重数据安全分级,你需要抓的是核心环节支撑能力:
- 是否支持把血缘关系导出为审计可读的格式
- 能否和现有调度平台打通,解析出自动血缘
- 手工补充血缘是否方便,毕竟不是所有加工逻辑都写成了SQL
- 字段级血缘的解析能力如何,只有表级血缘应对监管追问还差点意思
预算有限的机构,可以先从开源工具比如Apache Atlas、DataHub起步,配合定时脚本抽取元数据,也能搭建一套基本可用的血缘体系,等规模铺开了,再评估是否切换商业化平台。
量化数据血缘管理常见问题解答
数据血缘和一般的数据地图有什么区别?
数据地图是静态目录,告诉你“有什么”;数据血缘是动态路径,告诉你“从哪来到哪去”,合规留存的核心证明材料是数据血缘流程记录,它包含每一步的加工逻辑、时间戳和操作人信息,比数据地图更有法律凭证属性。
量化机构的数据合规整改方案一般包含哪些模块?
多数方案包含数据资产盘点、分类分级、血缘关系梳理、访问权限收敛、日志留存增强、数据销毁机制六个板块,血缘关系梳理是中间最关键的一环,它把盘点出来的资产清单和后续的权限控制、日志审计串联起来。
没有专职数据团队的小型量化工作室,数据血缘管理从哪里入手比较实际?
先用一套简单的元数据表格,把核心策略数据和交易数据的加工流程手工梳理一遍,重点覆盖最终用于实盘信号的因子数据链路,这通常是监管最关注的路径,等规模和受监管程度提升,再引入自动化血缘管理工具逐步完善。