视觉智能开放平台

首页 标签 视觉智能开放平台
SAM 2.1:Meta 开源的图像和视频分割,支持实时视频处理
SAM 2.1是由Meta(Facebook的母公司)推出的先进视觉分割模型,专为图像和视频处理设计。该模型基于Transformer架构和流式记忆设计,实现了实时视频处理,并引入了数据增强技术,提升了对视觉相似物体和小物体的识别能力。SAM 2.1的主要功能包括图像和视频分割、实时视频处理、用户交互式分割、多对象跟踪以及改进的遮挡处理能力。
LatentSync:根据音频生成高分辨率、动态逼真的唇形同步视频
LatentSync 是由字节跳动与北京交通大学联合推出的端到端唇形同步框架,基于音频条件的潜在扩散模型,能够生成高分辨率、动态逼真的唇同步视频,适用于影视、教育、广告等多个领域。
STAR:南京大学联合字节开源视频超分辨率增强生成框架,视频清晰度一键提升,支持从低分辨率视频生成高分辨率视频
STAR 是由南京大学、字节跳动和西南大学联合推出的视频超分辨率框架,能够将低分辨率视频提升为高分辨率,同时保持细节清晰度和时间一致性。
CogVideoX-Flash:智谱首个免费AI视频生成模型,支持文生视频、图生视频,分辨率最高可达4K
CogVideoX-Flash 是智谱推出的首个免费AI视频生成模型,支持文生视频、图生视频,最高支持4K分辨率,广泛应用于内容创作、教育、广告等领域。
|
6月前
| |
来自: 视觉智能
协作机器人和工业机器人的区别
协作机器人(Cobot)是专为人机协同设计的工业机器人分支,以安全、灵活、易用为核心,通过力控感知、速度监控与ISO/TS 15066认证实现无围栏共作;支持拖拽示教、快速换型,部署快、成本低、ROI短(6–18个月),适用于打磨、柔性装配、医疗辅助等非标场景。(239字)
|
6月前
| |
来自: 视觉智能
辐射超标、静电复位等等这些EMC问题背后藏着什么?
本文结合典型工程案例,系统解析EMC设计四大关键环节:结构屏蔽与接地(如悬空金属、散热器接地)、电缆与接口防护(如Pigtail问题、ESD保护)、滤波设计(如滤波器安装、TVS选型)及PCB布局(地平面完整性、滤波电容 placement)。强调EMC需前置设计,而非事后整改。(239字)
历史科普视频的AI自动化生产工作流:从全手动到半自动的工程演进
本文量化历史科普视频制作瓶颈,对比全手动(Stable Diffusion/GPT-SoVITS/Manim等开源栈)与半自动(花生AI为核心)方案。实测混合工作流将单期耗时从29–49小时压缩至10–15小时,效率提升60%+,兼顾质量、可控性与落地性。
|
6天前
| |
来自: 视觉智能
从 3.94 亿页书里捞出 2262 万个视觉元素
本研究提出轻量级视觉元素提取管线,面向哈佛图书馆数亿页古籍扫描,实现插图、乐谱、图表等五类非文本元素的检测、分类、去重与可选描述,最终释放2262万高质量视觉crop,兼顾精度、效率与可审计性。(239字)
免费试用