摘要记忆是什么?
AI 的上下文窗口有限,对话一长,早先说过的话就会被挤出去。摘要记忆的做法很直接:每隔一段,就让模型把「刚才聊了些什么」浓缩成一小段摘要存起来,后续只保留摘要,不再死扛全部原文。它和「完整记录」有什么区别?
完整记录:一字不落,费 Token把每轮对话原样存下,最保真,但窗口很快被塞满,成本也一路涨。
摘要记忆:抓重点,省空间
只留「结论、决定、关键事实」,用几句话替掉几百上千字的原文,省下的空间让给更重要的上下文。
摘要通常怎么生成?
让模型自己来写常见做法是交给 LLM:把一段对话丢给它,让它输出结构化摘要,比如「用户目标 / 已完成的步骤 / 待办事项」。
分层滚动
摘要还能再被摘要——当摘要也变多时,再合并成更高层的摘要,像金字塔一样逐层压缩。
好处与代价
好处:省 Token、能长期记住用极低成本把「来龙去脉」保留下来,多轮对话不容易「失忆」。
代价:细节会丢
压缩必然有损。用户随口提到的一个小偏好,可能就被摘要吞掉了。关键细节要另外单独存。
一句话记住:摘要记忆就是用「压缩」换「长期」,用一小段摘要替 AI 记住漫长的对话。
评论