背景:当 AI 走出文本,走进真实世界
过去十年,大语言模型(LLM)的爆发让 AI 拥有了前所未有的语言理解与生成能力。然而,真实世界从来不是纯文本的——它是图像的、声音的、空间的、多感官交织的。当 AI 从聊天窗口走向物理世界,从对话助手进化为具身智能体(Embodied AI),一个根本性的瓶颈浮出水面:
现有的记忆系统,几乎只能记住“文字”,却记不住“看见的东西”。
想象一下这样的场景:一台家庭服务机器人刚刚巡视了客厅,它“看到”茶几上放着一杯打翻的咖啡、沙发垫掉在地上、窗户半开着。但当主人问“家里有什么异常吗?”时,机器人只能回答:“抱歉,我没有相关记录。”,因为它所有的记忆模块都只接受文本输入,那些鲜活的视觉信息在存入记忆的门槛前就被丢弃了。这不是个例。在智能制造、自动驾驶、医疗影像分析、零售商品管理等众多领域,多模态记忆都是 AI 真正融入物理世界的基础设施。没有它,AI 永远只是一个“能说话但看不见”的智能体。
行业痛点:记忆系统的“文本牢笼”
当前主流的记忆系统,无论是 Mem0、LangMem、MemOS、MemGPT,还是 Zep、Memobase、SuperMemory,其核心设计都围绕文本记忆展开:
- 输入侧:仅接受字符串消息,不支持图片、文档、音视频等多模态内容;
- 存储侧:单一文本向量空间,所有记忆被压缩为文本 embedding;
- 检索侧:仅支持文本语义搜索,无法进行“以图搜图”等视觉相似度匹配。
这意味着,即便前端接入了强大的多模态大模型(如 GPT-4o、Qwen-VL),能够"看懂"图片和文档,但这些视觉理解的结果要么被丢弃,要么被粗糙地转写为一段文字后丢失了原始的视觉特征。AI 看见了,但没记住;或者记住了文字,但忘了画面。多模态记忆不是锦上添花的功能,而是具身智能、工业视觉、智能客服等场景的刚需基础设施。行业需要一个真正原生支持多模态的记忆系统。
PolarDB Agent Memory:原生多模态记忆系统
现有记忆系统困在文本牢笼里,前端多模态模型再强,存不进记忆就等于白看。PolarDB Agent Memory 要解决的就是这个问题。它是基于阿里云 PolarDB MySQL/PG数据库构建的企业级 AI 记忆系统,在兼容 Mem0 开源框架成熟的文本记忆能力基础上,原生扩展了完整的多模态记忆处理能力。它不是对现有文本记忆系统的简单补丁,而是从架构层面重新设计了多模态内容的接入、理解、存储与检索全链路。
3.1 PolarDB Agent Memory 多模态记忆能力

▶️ 3.1.1 “看懂并记住”:从图片中提取事实假设你给 AI 助手发了一张汽车照片,附带一句"这是我的新车"。传统记忆系统只会记住这句话本身,照片里车的颜色、型号、外观特征,这些最有价值的信息在存储环节就被丢掉了。PolarDB Agent Memory 的处理方式是:调用百炼多模态模型,先把图片"看懂",转换成结构化的文字描述(比如"一辆红色 SUV,车头有银色镀铬格栅"),再由 LLM 从中提取关键事实,最终向量化存入 PolarDB。整个流程对用户透明,你只管上传图片,剩下的交给记忆系统。
图片/文档 → 多模态模型 → 结构化文字描述 → LLM事实提取 → 文本embedding → PolarDB向量库
核心价值:用户可以用自然语言查询之前“看过”的图片内容。比如上传那张汽车照片后,直接问“这张照片中汽车的外观和型号?”,系统能基于提取的事实给出回答,而不只是回一句“您上传过一张图片”。
▶️ 3.1.2 “用图片找图片”:视觉 Embedding 检索文本搜索有一个绕不开的死角:你很难用文字精确描述一张图片的视觉特征。两张"蓝色运动鞋"的照片,文字描述可能几乎相同,但鞋型、鞋面纹理、鞋底设计可能完全不同。反过来,两张视觉上很相似的图片,文字描述可能南辕北辙。PolarDB Agent Memory 用视觉 Embedding 来解决这个问题。写入时,多模态模型提取图片的视觉特征向量,存入独立的视觉向量表;检索时传入查询图片,同样提取视觉特征,通过余弦相似度匹配返回最相关的结果。
ADD: 图片 → 视觉embedding模型 → 特征向量 → 视觉向量表
SEARCH: 查询图片 → 视觉embedding模型 → 特征向量 → 余弦相似度检索 → Top-K结果
核心价值:突破文本语义匹配的局限,实现真正的视觉相似度检索。颜色、形状、纹理、构图——这些文字难以捕捉的视觉特征,在向量空间里都能被精确度量。商品识别、车型匹配、缺陷检测这类"长得像但说不清像在哪"的场景,终于有了可靠的检索手段。
▶️ 3.1.3 “听过并记住”:音频记忆除了图像和文档,PolarDB Agent Memory 还支持音频。处理路径很直观:多模态模型将音频转录为文本,之后自动进入现有的文本记忆提取流程—转录、事实提取、向量化、入库,一气呵成。
音频 → 多模态模型 → 转录文本 → LLM事实提取 → 文本embedding → PolarDB向量库
核心价值:让 AI 能够"记住说过的话"。这意味着客服通话、会议录音、语音备忘等场景下,用户不需要手动转录,说过的内容就能自动沉淀为长期记忆。比如客户在电话里报修了一台设备,这段对话存入记忆后,下次客服可以直接问"上次报修的设备问题解决了吗?" AI 能从音频记忆中找到对应的记录。▶️ 3.1.4 “看过并记住”:视频记忆PolarDB Agent Memory 对视频采用“关键帧理解 + 音轨转写”的双通道处理:ffmpeg 按固定帧率抽取关键帧,经熵触发器自动过滤冗余画面后,由百炼 VL 模型对每帧生成画面描述,同时提取音频轨并转录为文本。画面描述与音频转写合并为结构化的视频内容描述,向量化后存入 PolarDB。
视频 → ffmpeg抽帧 → 熵触发器去冗余 → VL模型逐帧描述、音频轨提取 → 合并结构化描述 → 文本embedding → PolarDB向量库
核心价值:让 AI 能够"记住看过的视频"。课程录播、会议录像、监控回放、产品发布会等场景下,用户无需逐帧观看或手动整理,视频上传后系统自动完成画面与语音的理解并记忆,后续可通过自然语言检索视频内容。例如上传一段产品发布会视频后,可以直接问"视频中介绍了哪些新功能?",系统基于画面描述与音频转写的融合理解给出精准回答。
▶️ 3.1.5 技术特性一览以上能力背后,有几个关键的技术设计支撑着整个系统的运转:

3.2 PolarDB Agent Memory 企业级功能增强
多模态记忆解决的是"能不能记住"的问题。但在真实的生产环境里,光记住还不够,记忆会膨胀、会过时、会冲突,检索结果需要精准可控,不同租户之间需要隔离,运营团队需要看得见系统的运行状态。PolarDB Agent Memory 在多模态能力之外,针对这些问题提供了一整套治理手段,这些能力与多模态记忆深度协同,共同构成了完整的企业级竞争力。
▶️ 3.2.1 PolarDB 一体化存储:一个数据库搞定一切过去做 AI 记忆系统,常见的技术栈是这样的:向量数据存 Milvus 或 Pinecone,图关系存 Neo4j,业务数据存 MySQL 或 PostgreSQL,三套系统三套运维,数据一致性还得自己保证。PolarDB Agent Memory 基于 PolarDB 的向量+图+关系型一体化引擎,把这些全部收进一个数据库里。具体来说,文本向量和视觉向量独立存储、互不干扰,但删除某条记忆时,关联的视觉向量会被自动清理,不用开发者操心数据一致性。底层是 PolarDB 的云原生架构,存储和计算分离,按需扩缩容,多副本自动故障切换。模型方面深度集成阿里云百炼平台,不需要自建 GPU 推理集群,对于不想在基础设施上投入太多精力的团队来说,这一点很实际。
▶️ 3.2.2 记忆治理:从无序堆积到全生命周期管控记忆系统用久了,不可避免地会遇到这些问题:同一条信息被重复存储多次,过时的记忆挤占空间,有些记忆从来没人检索过却一直躺在那里。如果不治理,记忆库会越来越臃肿,检索质量也会下降。PolarDB Agent Memory 的治理思路是让记忆像数据一样可管理:
- 合并与冲突检测:系统空闲时像人类“做梦”一样,自动把零散、重复的碎片记忆聚类归纳为精炼的语义记忆;发现相互矛盾的记忆(如“病情还在持续”与“已经痊愈”)时,自动按最新记录取舍。
- 自动分类:提取的记忆可以根据分类模板自动打标签,检索时按标签过滤。比如客服场景下,可以把记忆分为“产品咨询”、“投诉建议”、“技术支持”等类别。
- 记忆衰减与过期管理:写入时可以指定记忆的过期时间,同时支持按时间衰减,被频繁引用的记忆权重更高,长期没人用的记忆逐渐“淡出”。
- 记忆变更历史:每条记忆的 INSERT/UPDATE/DELETE 操作都有记录,支持审计与回滚。
▶️ 3.2.3 多维度检索:不止于向量相似度单纯依赖向量相似度检索,在记忆量大了之后会遇到召回质量下降的问题。PolarDB Agent Memory 在向量检索之外叠加了多维度过滤:
- 分类/策略联合过滤:支持按分类标签 + 提取策略联合过滤,多维度筛选缩小检索范围。
- 数据库级分页:支持记忆分页检索返回,适合大规模记忆量的分页展示。
- 时间衰减搜索:结合时间衰减权重和半衰期参数,让近期上传的内容优先展示,这在很多实际场景中更符合用户预期。
- 跨身份记忆共享:支持将指定用户/agent的记忆授权给另一用户/agent,适用于多台机器人共享视觉记忆库、客服团队共享客户交互记录等多 Agent 协作场景。
▶️ 3.2.4 灵活的 Prompt 体系:一套系统适配多个场景不同业务场景对记忆提取的需求差异很大。电商场景可能关注商品偏好,医疗场景关注症状和用药史,金融场景关注风险偏好和交易习惯。如果只能用一套固定的 Prompt,很难兼顾所有场景。PolarDB Agent Memory 的做法是:同一套提取策略可以注册多个候选版本,运行时动态切换,不需要重启服务;支持请求级指定不同的提取策略,不同业务走不同策略;甚至同一请求可以同时指定多个策略并行提取,结果按策略标签隔离。Prompt 类型覆盖了事实提取、更新决策、合并、分类、画像抽取、关系提取等全流程。
▶️ 3.2.5 可观测性:让记忆系统的运行看得见记忆系统上线之后,运营团队需要回答这些问题:QPS 多少?延迟有没有毛刺?哪些记忆从来没被用过?Token 消耗是不是在预期范围内?PolarDB Agent Memory 提供了滑动窗口的实时性能监控(QPS、延迟、失败率),引用计数的分段统计(0-99、100-999、1000+),以及每次 LLM/Embedding/Reranker 调用的 Token 消耗、平均延迟追踪。还有 WebUI 管理界面,支持直接浏览、搜索、删除记忆,降低了运维门槛。
应用场景
4.1 智能制造:产线上的“视觉记忆”
工厂产线上,质检员每天要看成千上万个零件,靠肉眼和经验判断合格与否。问题是,人的经验很难传承,老质检员记得某类缺陷长什么样、出现在什么位置,新来的却只能翻手册。
PolarDB Agent Memory 能做的事是把这种“视觉经验”数字化。把历史良品和不良品照片上传进去,系统会通过 多模态模型提取缺陷类型、位置等信息存为事实记忆,同时生成视觉向量建立“视觉标准库”。产线相机实时拍摄产品图片后,以图搜图匹配历史记录:如果拍到的不良品和库里某个已知缺陷高度相似,系统自动判定并报警。此外,质检主管可以直接用自然语言问系统:“最近一周出现了哪些新型缺陷?”这个问题不再需要翻阅报表,提取的缺陷信息已经结构化地存在记忆里了。
4.2 医疗健康:影像诊断的“经验积累”
影像科医生的工作模式,某种程度上和产线质检很像:看片子、找异常、和既往病例对比。但一个医生一生能看过的病例是有限的,而且很多罕见病例可能只遇到过一次,下次再遇到类似影像时未必能想起来。
把历史病例的 CT/MRI 影像和诊断报告存入多模态记忆后,系统会通过多模态模型提取病灶描述(位置、大小、形态特征),同时生成视觉向量。当医生上传新患者的影像时,系统通过视觉相似度检索找到历史相似病例,结合模型提取的病灶描述,辅助医生快速定位疑似病变区域。这相当于给医生配了一个“过目不忘”的助手:它见过所有存进系统的病例,而且能在几秒内找到视觉上最相似的历史影像。
4.3 家庭服务机器人:既看得见又听得懂
回到文章开头那个场景:机器人巡视了客厅,看到茶几上打翻的咖啡、半开的窗户,但如果记忆系统只存文本,这些视觉信息就全丢了。有了多模态记忆,情况完全不同。机器人巡视时将看到的场景存入记忆,主人回家后问“家里有什么变化?”,系统能通过视觉对比发现异常,用自然语言汇报:“茶几上有打翻的咖啡,客厅窗户半开着。”长期积累下来,机器人还能回答“钥匙通常放在哪里?”这类个性化问题。
但多模态记忆的价值不止于视觉。想象一下:主人一边收拾客厅一边对机器人说“明天下午三点有快递要来”。这段语音会自动转录、提取关键信息、存入记忆。到了第二天下午两点五十,机器人主动提醒:“您昨天说过今天下午三点有快递。”视觉记忆让机器人记住“看到的”,音频记忆让它记住“听到的”,两者结合,才是一个真正“既看得见又听得懂”的家庭助手。
快速体验
▶️ 步骤一:创建并配置 PolarDB AgentMemory 长期记忆实例登录阿里云 PolarDB Agent Memory 控制台创建实例:
- 登录控制台:https://yaochi-buy.aliyun.com/polardb-mem0?
- 创建PolarDB Agent Memory实例
- 等待实例状态变为「运行中」,在实例详情页获取:公网地址、API Key
- 在实例详情页的白名单区域配置白名单,将您的客户端或测试服务器的IP地址添加到白名单中
▶️ 步骤二:多模态记忆测试三步上手
# 1. 上传一张图片
curl -X POST http://<server>:8080/v3/memories/multimodal \
-H "Content-Type: application/json" \
-H "Authorization: Token <your_token>" \
-d '{
"user_id": "demo_user",
"image": "https://example.com/car.jpg",
"text": "我的新车,黑色侧面视角",
"metadata": {"original_image_url": "https://example.com/car.jpg"}
}'
# 2. 自然语言查询
curl -X POST http://<server>:8080/v2/memories/search \
-H "Content-Type: application/json" \
-H "Authorization: Token <your_token>" \
-d '{
"query": "我的车是什么型号?什么颜色?",
"filters": {"user_id": "demo_user"},
"top_k": 5
}'
# 3. 以图搜图
curl -X POST http://<server>:8080/v3/memories/visual-search \
-H "Content-Type: application/json" \
-H "Authorization: Token <your_token>" \
-d '{
"image": "https://example.com/query_car.jpg",
"user_id": "demo_user",
"top_k": 3
}'
👉点击 https://help.aliyun.com/zh/polardb/polardb-for-mysql/instructions-for-using-the-memory-management-api 查看完整 API 使用说明文档。
👉使用过程中有任何问题,可通过钉钉搜索群号:159370018139入群咨询。
结语
多模态记忆不是 AI 的附加功能,而是 AI 走进真实世界的入场券。
当具身智能从实验室走向千家万户,当工业机器人从预设程序走向自适应学习,当 AI 助手从“听你说”进化到“看你做”,一个能同时记住文字、音频和画面的记忆系统,就是这一切的基石。PolarDB Agent Memory 正是为此而生,我们不满足于让 AI “能说会道”,更要让它“过目不忘”。
💻 点击查看「PolarDB Agentic Database」系列文章:
《Agent时代的第一块数据地基:PolarDB Agent全栈数据基座到底是什么?》
《给数据库装上“Git”:PolarDB让Agent安全试错》
