视觉智能开放平台

首页 标签 视觉智能开放平台
|
5天前
| |
来自: 视觉智能
YOLO26知识蒸馏:一行代码,0.4-1.0个点,零推理开销
YOLO26原生支持知识蒸馏,仅需一行`distill_model`参数,即可让轻量学生模型(如yolo26n/s)从大模型(如yolo26x/l)中学习“暗知识”,在推理零开销、速度体积不变前提下,精度最高提升1.0 mAP,特别适合边缘部署场景。
|
5天前
| |
来自: 视觉智能
在浏览器中实现电影级景深:Depth Anything V2 Small、WebGPU 与本地视频编辑实践
Timeline Studio 开源视频编辑器集成 Depth Anything V2 Small 模型,基于 WebGPU 在浏览器本地实现照片/视频场景深度分析,生成可实时调节、保存导出的电影级景深效果,全程不上传原始媒体。
|
6天前
| |
来自: 视觉智能
实时快速核验银行卡-身份证实名核验-API接口-SDK集成
身份证与银行卡实名核验API,支持二至四要素实时校验,直连官方权威数据源,毫秒级响应、零缓存。返回匹配结果及性别、生日、籍贯、发卡行等丰富信息,适用于注册认证、信贷风控、支付验证等场景,助力企业快速合规验真。
|
6天前
| |
来自: 视觉智能
浏览器端多语种 AI 配音卡在 86%?从 WebGPU、WASM 到模型缓存治理的完整修复实践
本项目实现浏览器端AI配音,无需上传数据、降低服务器成本。针对模型常卡在86%、多语言加载失败等痛点,通过统一缓存身份、双镜像下载、Q8量化模型、WASM回退、智能缓存清理及分阶段进度提示等方案,彻底解决QuotaExceededError,支持中英日韩泰等多语种稳定本地合成。
|
8天前
| |
来自: 视觉智能
阅读笔记:DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth
本文提出免标注OCR引擎选择框架DocOCR-Eval:利用MLLM作为校正器,通过三阶段错误诊断(字符/分词/语义)条件触发文本或视觉重识别校正,以校正后ANLS差异自动排序引擎。在FUNSD等数据集上NDCG达0.9752,验证了思路可行性,但验证尚不充分(仅3/9数据集、4引擎、prompt未公开)。
|
12天前
| |
来自: 视觉智能
浏览器端 AI 视频人物描边实践:MODNet、SlimSAM、MediaPipe 与光流融合方案
Timeline Studio 实现浏览器端AI视频人物描边:融合YOLOS检测、MODNet抠像、MediaPipe清理、SlimSAM修复与Farneback光流传播,在WebGPU/WASM下本地运行,无需上传隐私视频,支持移动端与实时材质渲染。
|
16天前
| |
来自: 视觉智能
甲醛 (HCHO) 总柱扫描轨道
OMPS-N20 L2 NM甲醛总柱浓度产品源自NOAA-20卫星OMPS星下点仪,基于328.5–356.5 nm辐射反演全球日均HCHO柱浓度。空间分辨率12–17 km,覆盖全球,每日约14.5轨,采用netCDF-4格式,支持NASA Earthdata一键检索与下载。
|
26天前
| |
来自: 视觉智能
测试一下发文章
测试一下发文章
历史科普视频的AI自动化生产工作流:从全手动到半自动的工程演进
本文量化历史科普视频制作瓶颈,对比全手动(Stable Diffusion/GPT-SoVITS/Manim等开源栈)与半自动(花生AI为核心)方案。实测混合工作流将单期耗时从29–49小时压缩至10–15小时,效率提升60%+,兼顾质量、可控性与落地性。
|
2月前
| |
来自: 视觉智能
AI短剧/AI广告生成实战流程:阿里云百炼新上线的HappyHorse 1.1功能详解、参数调试、成本指南
HappyHorse是阿里云推出的端到端AI视频生成大模型,2026年6月22日正式上线迭代版本HappyHorse 1.1,部署在阿里云百炼平台对外开放API调用与在线调试能力,主打短剧、电商广告、品牌宣传片、内容营销短片四大商用内容场景。相比初代HappyHorse 1.0,新版本在动态时序、角色一致性、画面质感、音画协同、长指令理解五大核心维度完成系统性升级,解决旧版动作僵硬、人物面部失真、多角色画面互相污染、长分镜逻辑断裂等行业常见痛点。
免费试用