一场 2 小时的产品发布会录屏,一学期的在线课程,一整天的会议录音,不用的时候,它们都在知识库里——准确地说,是都”存”在知识库里。
直到你想找第 47 分钟讲的那句话、想核对一个只在画面里出现 3 秒的参数,想基于音频视频内容总结精选,产出一篇推文、一份报告、一段总结,苦于迎接你的是一条没有坐标的进度栏,和一份对不上画面的转录稿。
音视频知识难的不是存,是找。现在,阿里云百炼知识库 4.1 音视频知识库能力升级:剧情解析、说话人分离、智能切片、多模态检索、时间戳溯源——让知识库先”看懂”视频,再告诉你答案在哪一段。
音视频识别检索能力 行业SOTA!
01 / 🖼️ 不只是转字幕,而是看懂画面里发生了什么
过去的音视频解析,本质是把语音变成文字。可信息一旦长在画面里——讲师的手势、PPT 的切换、商品的特写——转录稿就看不见了。
阿里云百炼知识库 4.1 版本在音视频解析路径下新增 剧情解析:综合音频与画面,按时间分段生成剧情或知识大纲。配合 说话人分离,这意味着知识库具备了极强的“识人”能力——不仅能听懂谁在说话,还能自动拆解视频里的人物角色。以后找素材,你可以像用长视频平台一样,直接检索并提取“只看某某明星/特定发言人”的专属片段。
▲转录文稿· 自动解析角色并拆分片段
转录稿里谁在什么时间点说了什么,一眼可辨。视频还支持抽帧帧率设置,0.2 到 5 帧/秒可选,默认 1 帧/秒:信息密集的公开课调高,节奏平缓的录屏调低,解析的颗粒度由你掌握。
切片这一层,内容智能切片、语音语义切片、音频按字符切片、合并短片段四种策略——不同类型的内容用不同的切法,检索回来的片段才完整、不被拦腰截断。建库时,解析与切片配置当场回显,索引字段可以自己选:哪些内容参与检索,建库那一刻就清楚。
▲解析设置· 视频切分方式与帧率(0.2 – 5 帧/秒)
镜头高光识别与自定义Prompt 高光规则:系统会先从长视频里替你挑出关键动作与重要结论。
02 / 🔍 用一张图搜视频,用一个答案取证据
字幕关键词检索有一个天然边界:画面里的东西,从来没被说出口。阿里云百炼知识库 4.1 升级版本:文本内容与视频抽帧画面一起进入统一的语义空间。文字、图片、视频帧,第一次可以互相找到对方。
▲创建知识库· 快速索引设置
在此基础上,检索测试与问答入口新增 图片Query:上传一张截图、商品图或场景图,直接搜相关视频片段;也可以“图片+ 文字”组合查询,让视觉与语义信号一起出力。召回结果带时间戳,点击即可定位播放。
▲检索测试· 图片Query 输入入口· 召回结果时间戳与媒体预览
两个条件,缺一不可:建库时选择 模型解析方式,并把「抽帧图片」选为索引字段。
找到了,还要看懂。切片详情升级为 多视图:画面总结、带说话人和时间点的转录文稿、剧情解析知识大纲并列呈现,再配一个内嵌播放器——从当前片段起点直接播。不必在原视频、字幕文件和知识库切片之间来回切换。
系统不仅会告诉你这段说了什么,还会为你总结出画面里发生了什么。对于动辄几小时的课程或会议录屏,你终于可以实现“精准点播”——跳过废话,直接选择一个视频中某一段核心剧情来看。
▲切片详情多视图· 内嵌播放器自片段起点播放
问答的能力也同步做了升级,知识问答新增 混排富回复:生成文字答案的同时,展示相关视频片段的缩略图、时间区间和播放入口——结论与证据同屏。
▲知识问答· 文字答案与视频片段混排富回复
点任意一个时间戳,播放器在结果卡片内展开,定位到原视频的对应时间点。从答案回到原始上下文,少拖一次进度条。
▲检索与问答结果· 时间戳一键跳回原视频
03 / 💻 把音视频知识,放进真正在跑的工作流
能力的终点从来不是控制台,而是你每天在用的那套工作流程和 Agent 办公助理。一种已经在跑的组合:音视频知识库+ 「千问办公」。
把素材视频、发布会录屏存入知识库完成解析与索引,Agent 应用和助手可以直接调用检索与问答——写媒体文案时不必再把视频二倍速看两遍,问一句,它找到那一段、给出结论和视频证据,文案初稿随之而来。
▲案例:音视频知识库 + 千问办公快速实现信息抽取与媒体文案生成
知识库 4.1 支持轻松挂载 阿里云百炼 Agent Studio,及Dify、Coze、n8n、LangChain 等各类 AI 应用开发平台,和常见Agent工具,让你的 Agent 立即开启多模态知识理解的创造之旅!
04 / 🕹️ 体验入口:
https://rag.console.aliyun.com/rag/playground
快来体验吧!