快速上手¶
在合成数据上、约一分钟内端到端跑完整条预训练-微调训练流水线——无需 CSMAR 数据、无需 GPU——最终得到四份资产嵌入 CSV(W2V-PT、W2V-FT、BERT-PT、BERT-FT)。这是论文估计流程的微缩版。
准备环境¶
git clone https://github.com/Initial-Singularity/AssetEmbeddingsInChina
cd AssetEmbeddingsInChina
uv sync --extra notebook
运行¶
该 notebook 使用 examples/data/ 中随附的合成数据集——每个数值都是生成的,因此无需任何外部数据。
它做了什么¶
notebook 跑的是 W2V-PT → W2V-FT → BERT-PT → BERT-FT 链路——与论文相同的训练阶段,只是用的是玩具数据:
- W2V-PT——在合成的组合“句子”上训练 Skip-gram Word2Vec。
- W2V-FT——在微调期数据上继续训练 W2V,从预训练向量出发(PT→FT)。
- BERT-PT(预训练)——在汇总的历史数据上训练 BERT,其嵌入层由 W2V-PT 矩阵热启动(W2V→BERT)。
- BERT-FT(微调)——按“季度”精修 BERT,编码器从预训练模型初始化(PT→FT),嵌入层由 W2V-FT 热启动(W2V→BERT)。
每个阶段都把其嵌入写成一份 (Token, Embed_1..Embed_d) CSV——这正是流水线的交付物。
你应当看到什么¶
运行结束时会打印四份嵌入 CSV 的汇总表(模型、训练数据、形状、路径),并快速展示它们编码了什么:某只探针股票在各嵌入空间中的 top-5 余弦近邻。合成 universe 带有潜在的簇结构,因此一只股票的近邻应当留在其所属簇内;两个微调模型会一同捕捉到微调期的漂移,而两处初始化(W2V→BERT、PT→FT)则让四份嵌入彼此可比。(具体近邻随合成种子而变,但簇结构是稳定的。)