特征存储是什么?
机器学习里,「特征」(feature)就是喂给模型的那一列列输入:用户的年龄、近 30 天下单次数、商品价格…… 特征存储(Feature Store),就是把这些特征集中存放、统一管理的一个「仓库」。它让训练和线上推理都用同一套特征,谁要用、直接来取。它解决的核心痛点是什么?
训练和推理不一致训练时用一套脚本算特征,上线时又用另一套逻辑现算,两边对不上,模型线上表现就会「翻车」。特征存储把特征统一存好,训练、推理都从这里取,保证一致。
重复造轮子
同一个特征,不同团队各写各的,又慢又容易错。集中管理后,算一次、到处用。
特征难复用、难治理
特征散落在各处的脚本里,想找、想改、想追溯都难。特征存储给它们一个「家」,还带上版本和血缘信息。
它通常长什么样?
在线存储推理时要求低延迟,用 Redis 这类内存库,毫秒级取到特征。
离线存储
训练用的大批量历史特征,放数据仓库或对象存储里。
特征注册表
记录每个特征的定义、来源、版本,方便发现和复用。
什么时候该用它?
当你发现团队里「同一个特征被算了好几遍」、或者「训练好好的、上线就崩」时,特征存储往往就是那把钥匙。它是 MLOps 基础设施里越来越重要的一块。一句话记住:特征存储就是特征的「中央仓库」,训练推理同一套,算一次、处处用、线上线下不打架。
评论