1.概述 在计算完因子数据之后,进行下一步的模型训练之前,通常需要对因子数据进行预处理,以及中性化处理。其中预处理比较简单,一般就是3倍MAD截断,zscore标准化,缺失值填充为0。中性化稍微复杂一些,本文将从市值中性化开始介绍如何进行市值中性化,下一篇将介绍如何进行行业中性化。 2.市值中性化 2.1市值中性化的必要性与逻辑 市值中性化是因子中性化处理中最常见且重要的一种,其核心目的是剔除因子值中由于市值(Size)因素引起的系统性影响,使得因子能够更纯粹地反映其自身的信息,从而提升因...
1.概述 在过去,想要复现一篇多因子研究的研报往往是一项艰巨的任务。市面上缺乏成熟、统一的多因子研究平台,研究者不得不从零开始:自行下载数据、进行复杂的数据清洗、构建因子库,搭建因子评价体系,整个过程既耗时又容易出错。对于那些没有编程基础、但对量化投资充满兴趣的人来说,这几乎成为一道无法跨越的门槛。许多想入门的人因此望而却步,迟迟无法真正踏入量化研究的大门。 而如今,PandaAI的出现极大地降低了量化的门槛。它为因子研究提供了一个高效、统一、易用的平台,只需掌握一套简单的函数体系,就可以快...
开篇:什么是量化投资? 想象你是一个经验丰富的菜市场买菜高手。每次买菜时,你都有自己的一套"规则": 西红柿要挑红润饱满的 价格比平时低20%时大量采购 避开周末人多的时候去买 量化投资就是把这套"买菜经验"用代码写出来,让电脑帮你在股市里"买菜"。 传统投资靠感觉和经验,量化投资靠的是数据+规则+纪律执行。就像用GPS导航代替问路一样,虽然偶尔会绕路,但长期看更靠谱。 为什么从双均线开始? 双均线策略是量化投资的"九九乘法表",简单但包含了完整的投资逻辑: 趋势判断:短期均线长期均线...
1.概述 行业中性化(IndustryNeutralization)旨在从因子中剔除行业所带来的系统性偏差,使因子能够更真实地反映个股的特质(idiosyncraticcharacteristics)。许多因子天然地与特定行业相关联,比如市盈率因子在金融行业普遍较低,而在科技行业可能较高。 行业中性化通常通过分行业去均值或引入行业哑变量回归等方式实现,处理后因子值在行业间趋于均衡,从而避免策略因行业偏好而产生非预期的暴露。经过行业中性化处理的因子,更具普适性和解释力,在多因子模型、因子排序及回...
1.概述 接上一篇,为什么在A股动量因子会呈现出反转特征呢?直接说答案,就是因为散户太多了。 这篇文章我们将分享《中金公司-量化多因子系列(6):关于动量,你所希望了解的那些事》提到的四类投资者,我们试着从投资者结构的角度出发去揭示反转特征,同时也思考作为个人,应该选择成为哪一个象限的投资者。 2.A股投资者结构下的四类典型投资者画像 在理解动量为何在A股呈现出“反转特性”之前,我们需要从投资者结构出发,分析不同类型投资者的行为模式及其对市场价格形成机制的影响。 我们可以从两个维度对投资者...
上一篇文章我们介绍了高频因子的动量反转类因子,这一篇继续介绍波动率因子,并在因子分析的基础上加入策略回测。 研究环境利用聚宽因子分析API,构建因子函数类;研究在日内高频分钟级数据中挖掘构建高频因子,对该因子进行有效性检验,并利用回测平台进行回测。 一波动率因子 1.1波动率因子构建 第二大类因子为波动率因子。波动率因子刻画了股票价格或股票收益在过去一段时间的不确定性程度,高波动率通常反映其不确定性程度较高,未来收益表现可能相对较弱。  将传统的收益波动、振...
1.概述 这两天看到一个开源项目,[TradingAgents项目GitHub](https://github.com/TauricResearch/TradingAgents)还挺火的,下来来玩了玩,给大家分享下。  这涨星的速度还是可以的。 2.安装 安装就看github上的readme页有介绍。  先把各个库安装好,如果没有安装conda的,需要先安装下conda。 环境安装好之后,还需要设置KEY,一共有两个  二、MongoDB用于多因子分析的优势 传统的关系型数据库就像一个个整齐排列的小格子房间,每个房间的大小、形状都得提前规定好,东西得规规矩矩地放进去。而Mongo...
1.概述 笔者最近搭建了一套因子库,参考的是《20230522-招商证券-AI系列研究之一:端到端的动态Alpha模型》附录中的因子,但因子数量还是有限,于是决定引入一些常见的因子库,本文将分享如何用cursor来帮我们快速生成alpha101因子。 2.cursor安装与激活 从官网下载cursor,新注册的用户有免费的使用次数,如果次数用完,可以到某宝上去购买账户,也可以自己充值。  安装好之后,就可以在右边打开对话框,进行对话式编程了,选择@可以指定代码...
1.概述 平时大家搭建自己的因子库,肯定要会涉及到行情数据的下载,因子库的计算入库等工作,股票数据相对来说数量比较大,更新一次需要不少时间,本文将分享如何通过多线程的方式加快数据的下载,以此为例,也可以扩展到其他大数据任务的计算中。 本文使用Tushare作为数据源,下载A股市场所有股票的日线数据(open,high,low,close,vol),我们将分析串行跟并行两种方法在时间效率上的表现。 2.串行下载 串行下载是最直观的实现方式,按顺序逐个处理每只股票的数据下载请求。注册好tushar...