|
人工智能 图形学 计算机视觉
|
置顶
通义万相

通义妙谈 -图像模型玩转更多可能!通义万相新升级 一个包罗万象的“应用广场”!

“买家秀”秒变“卖家秀”,AI一键更换商品模特,虚拟模特功能等你解锁🔒 “小草图”秒变“大制作”,AI涂鸦作画让你的草图“一秒”成画🖌️ “2-4图”生成“个人写真”,AI虚拟分身在线创作,在家也是巴厘岛🏖️ 阿里云的微博视频 全网征集灵魂画手,几笔生成精美大作,精美礼物等你来拿

1856 3
来自: 通义万相  版块
|
人工智能 图形学 计算机视觉
|
置顶
通义万相

通义万相—涂鸦作画功能上线~欢迎体验

通义万相应用广场中新增功能:涂鸦作画~用户可试试在画板上涂鸦并结合描述生成画作,快来体验吧~

14852 10
来自: 通义万相  版块
|
人工智能 图形学 计算机视觉
|
置顶
通义万相

通义万相—写真馆功能上线,欢迎体验~

通义万相应用广场中新增功能:写真馆~用户上传2-4张真人照片,即可获得专属写真大片,快来体验吧~

3110 5
来自: 通义万相  版块
|
人工智能 图形学 计算机视觉
|
置顶
通义万相

通义万相—虚拟模特功能上线,欢迎体验~

通义万相应用广场中新增功能:虚拟模特~用户可上传真人实拍商品展示图,获取模特大片。快来体验吧~

12348 8
来自: 通义万相  版块
置顶
通义万相

通义妙谈-阿里云图像生成大模型通义万相,Composer算法实现绘图精准可控

通义妙谈-阿里云图像生成大模型通义万相,Composer算法实现绘图精准可控

14017 68
来自: 通义万相  版块
|
物联网 开发者 异构计算
|
置顶

facechain人物写真生成工业级开源

facechain人物写真应用自8月11日开源了第一版证件照生成后。目前在github(GitHub - modelscope/facechain: FaceChain is a deep-learning toolchain for generating your Digital-Twin.)上已有5.7K的star,论文链接:FaceChain: A Playground for Identity-Preserving Portrait Generation:https://arxiv.org/abs/2308.14256。

1575 5
|
人工智能 编解码 算法
|
置顶

【IJCAI 2023】流感知优化之 DAMO-StreamNet 论文解读

传统视频目标检测(Video Object Detection, VOD)是离线(offline)的检测任务,即仅考虑算法的检测精度,未考虑算法的延时。流感知(Streaming Perception)任务作为VOD的一个细分方向,采用流平均精度(Streaming Average Precision, sAP)指标,衡量算法的在线(online)检测能力,即同时衡量算法的精度和延时。本文针对现有的流感知工作在训练方式和模型感受野两方面的不足,提出了DAMO-StreamNet,在保证算法实时性的前提下,实现了SOTA的性能。

2159 6
|
机器学习/深度学习 人工智能 自然语言处理
|
置顶

ChatGPT最强专业学习资料集锦

本文旨在整理一份可供参考和学习的专业ChatGPT相关资料,包括ChatGPT相关论文、Github项目、以及当前市场上出现的ChatGPT相关产品等。

1666 5
|
机器学习/深度学习 搜索推荐 计算机视觉
|
置顶

【阿里云OpenVI-人脸感知理解系列之人脸识别】基于Transformer的人脸识别新框架TransFace ICCV-2023论文深入解读

本文介绍 阿里云开放视觉智能团队 被计算机视觉顶级国际会议ICCV 2023接收的论文 "TransFace: Calibrating Transformer Training for Face Recognition from a Data-Centric Perspective"。TransFace旨在探索ViT在人脸识别任务上表现不佳的原因,并从data-centric的角度去提升ViT在人脸识别任务上的性能。

3872 343
来自: 人脸人体  版块
|
机器学习/深度学习 编解码 算法
|
置顶

【阿里云OpenVI-视觉生产系列之图片上色】照片真实感上色算法DDColor ICCV2023论文深入解读

图像上色是老照片修复的一个关键步骤,本文介绍发表在 ICCV 2023 上的最新上色论文 DDColor

4699 11
来自: 视觉生产  版块
|
AI芯片
|
置顶

AIGC视频生成/编辑技术调研报告

随着图像生成领域的研究飞速发展,基于diffusion的生成式模型取得效果上的大突破。在图像生成/编辑产品大爆发的今天,视频生成/编辑技术也引起了学术界和产业界的高度关注。该分享主要介绍视频生成/编辑的研究现状,包括不同技术路线的优劣势,以及该领域当下面临的核心问题与挑战。

2393 3
来自: 视觉生产  版块
|
机器学习/深度学习 人工智能 达摩院
|
置顶

AIGC玩转卡通化技术实践

伴随着持续不断的AIGC浪潮,越来越多的AI生成玩法正在被广大爱好者定义和提出,图像卡通化(动漫化)基于其还原效果高,风格种类丰富等特点而备受青睐。早在几年前,伴随着GAN网络的兴起,卡通化就曾经风靡一时。而今,伴随着AIGC技术的兴起和不断发展,扩散生成模型为卡通化风格和提供了更多的创意和生成的可能性。本文就将详细介绍达摩院开放视觉团队的卡通化技术实践。

57966 5
来自: 视觉生产  版块
|
编解码 人工智能 移动开发
|
置顶

AIGC图像分辨率太低?快来试试像素感知扩散超分模型,你想要的细节都在这里

阿里巴巴最新自研的像素感知扩散超分模型已经开源,它把扩散模型强大的生成能力和像素级控制能力相结合,能够适应从老照片修复到AIGC图像超分的各种图像增强任务和各种图像风格,并且能够控制生成强度和增强风格。这项技术的直接应用之一是AIGC图像的后处理增强和二次生成,能够带来可观的效果提升。

1838 4
|
自然语言处理 测试技术 计算机视觉
|
置顶

OpenVI-感知理解系列之GAP骨骼点动作识别 ICCV23顶会论文深入解读

本文介绍了ICCV23中稿论文 GAP: Generative Action Description Prompts for Skeleton-based Action Recognition

2362 2
来自: 图像理解  版块
|
机器学习/深度学习 人工智能 达摩院
|
置顶

港大阿里“视觉AI任意门”,一键向场景中无缝传送物体

本文主要展示了阿里和港大的AI版「任意门」,实现零样本的图像嵌入。

1982 3
|
人工智能 自动驾驶 算法
|
置顶

本地生活技术雷达——生成式AI(Generative AI)在阿里本地生活的应用与思考

本地生活技术雷达是由本地生活技术中心战略管理&PMO团队开展的,定期扫描和评估新兴技术的战略研究工作。目的是对技术趋势进行前瞻性预判,提出新技术布局建议,在技术驱动业务创新和业务增长、践行社会责任等方面有一些实质性探索。 本篇尝试探讨 1)理解AI范式——从分析型(Analytical AI)到生成式(Generative AI)的拐点在2022年,其对人类社会以及商业模式的长期影响; 2)生成式AI(文生文、文生图、图生图等)在本地业务目前场景的应用和未来的方向。 欢迎技术、产品、运营、战略、管理层、国内国际等各种视角的指点和碰撞!

40506 8
|
1天前
|
传感器 人工智能 算法
|

宠物友好社区智能门禁:猫狗识别算法应用与技术实现

随着现代家庭中宠物角色的转变,它们不仅是宠物,更是家庭成员。传统的宠物门(如 flap door)存在破坏门体、保温性差、无法控制进出对象等痛点,基于猫狗识别算法的智能门禁系统,为宠物提供了一种更智能、安全、自主的通行解决方案。本文将深入介绍该技术的核心原理、实现挑战及其应用价值,也结合宠物AI算法解决方案探讨如何应对技术真正落地遇到所遇到的问题,希望能给各位开发者一些帮助。若有不足之处,还望指正。

43 0
来自: 图像理解  版块
|
7天前
|
人工智能 数据库 Python
|

AI短剧赛道冰火两重天:创作者暴增但变现率暴跌

AI短剧半年从风口到过剩:创作者暴增13倍,人均收入却暴跌超80%。本文用纯Python标准库模拟12个月数据,直观呈现“产量飙升、收益塌方”的剪刀差困局,揭示流量红利摊薄下的生存真相。(239字)

53 0
|
8天前
|
文字识别 测试技术 数据安全/隐私保护
|

医疗票据OCR与理赔规则自动化:从信息孤岛到智能审核的全链路技术解析

在商业医保与TPA理赔业务中,票据信息提取低效、规则适配脱节、数据标准混乱,长期制约着理赔时效与风控精度。本文从技术视角拆解OCR+知识图谱+规则引擎的融合方案,以快瞳医疗OCR的应用为样本,并附常见实施问题解答,助力企业构建可落地的智能化理赔底座。

98 2
|
10天前
|
人工智能 数据库
|

企业 Agent 引用投标资料前,如何增加来源、版本和有效性门禁

企业 Agent 引用旧投标资料时,应把来源、版本、有效期、责任人和复核状态作为入库门禁,并通过可复用、待复核、禁止复用三态控制引用与异常回退。

78 0
|
11天前
|
存储 定位技术 API
|

大空间AR地图更新怎么避免现场错版:一份发布清单与校验脚本

用一份不含密钥的发布清单绑定Block、定位库、客户端、内容包和回滚目标,并提供可放入CI的Python校验脚本。

61 0
|
11天前
|
算法 API 定位技术
|

Unity接入EasyAR Mega的发布前自检:用Editor脚本排查五类配置问题

提供一个可直接放入Unity项目的Editor自检脚本,排查EasyAR Mega接入中的插件包、Android构建配置、License与包名、服务权限及Block层级问题。

83 2
|
13天前
|
人工智能 自然语言处理 运维
|

企业Agent进入投标协作:如何设计可追溯、可恢复的人工交接点

企业Agent进入投标长任务后,需要记录输入版本、原文依据、当前产出、风险、责任人与人工放行状态,才能实现可追溯、可恢复的协作。

96 0
|
13天前
|
数据采集 算法 安全
|

AR眼镜进入餐饮服务现场:如何设计一套可复现的场景测试

基于澳门旅游大学AR智慧餐饮研究,拆解技术可靠性、任务表现、人因和运营四层测试方法。

87 0
|
14天前
|
运维 算法 安全
|

大空间AR导航如何落地:VPS定位、地图更新与AR眼镜端的工程闭环

本文从地图生产、VPS首次定位、终端连续跟踪、路线与内容锚定、AR眼镜端约束以及地图更新运营等方面,拆解大空间AR导航的完整工程链路。

103 0
|
14天前
|
算法 安全 测试技术
|

VPS定位系统的离线评测设计:从首次定位到地图更新回归

本文给出一套VPS定位系统的离线评测方法,涵盖版本化输入、分层样本、指标矩阵、失败分类、地图更新回归以及线上观测闭环。

117 0
|
1月前
|
计算机视觉 异构计算
|

YOLO26知识蒸馏:一行代码,0.4-1.0个点,零推理开销

YOLO26原生支持知识蒸馏,仅需一行`distill_model`参数,即可让轻量学生模型(如yolo26n/s)从大模型(如yolo26x/l)中学习“暗知识”,在推理零开销、速度体积不变前提下,精度最高提升1.0 mAP,特别适合边缘部署场景。

197 1
|
1月前
|
缓存 人工智能 编解码
|

在浏览器中实现电影级景深:Depth Anything V2 Small、WebGPU 与本地视频编辑实践

Timeline Studio 开源视频编辑器集成 Depth Anything V2 Small 模型,基于 WebGPU 在浏览器本地实现照片/视频场景深度分析,生成可实时调节、保存导出的电影级景深效果,全程不上传原始媒体。

193 1
|
1月前
|
缓存 JSON 小程序
|

实时快速核验银行卡-身份证实名核验-API接口-SDK集成

身份证与银行卡实名核验API,支持二至四要素实时校验,直连官方权威数据源,毫秒级响应、零缓存。返回匹配结果及性别、生日、籍贯、发卡行等丰富信息,适用于注册认证、信贷风控、支付验证等场景,助力企业快速合规验真。

178 1
|
1月前
|
存储 缓存 人工智能
|

浏览器端多语种 AI 配音卡在 86%?从 WebGPU、WASM 到模型缓存治理的完整修复实践

本项目实现浏览器端AI配音,无需上传数据、降低服务器成本。针对模型常卡在86%、多语言加载失败等痛点,通过统一缓存身份、双镜像下载、Q8量化模型、WASM回退、智能缓存清理及分阶段进度提示等方案,彻底解决QuotaExceededError,支持中英日韩泰等多语种稳定本地合成。

167 1
|
1月前
|
移动开发 文字识别 自然语言处理
|

阅读笔记:DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

本文提出免标注OCR引擎选择框架DocOCR-Eval:利用MLLM作为校正器,通过三阶段错误诊断(字符/分词/语义)条件触发文本或视觉重识别校正,以校正后ANLS差异自动排序引擎。在FUNSD等数据集上NDCG达0.9752,验证了思路可行性,但验证尚不充分(仅3/9数据集、4引擎、prompt未公开)。

151 1
来自: 文字识别  版块
|
2月前
|
人工智能 缓存 编解码
|

浏览器端 AI 视频人物描边实践:MODNet、SlimSAM、MediaPipe 与光流融合方案

Timeline Studio 实现浏览器端AI视频人物描边:融合YOLOS检测、MODNet抠像、MediaPipe清理、SlimSAM修复与Farneback光流传播,在WebGPU/WASM下本地运行,无需上传隐私视频,支持移动端与实时材质渲染。

171 1
来自: 视频分割  版块
|
2月前
|
编解码 Python
|

甲醛 (HCHO) 总柱扫描轨道

OMPS-N20 L2 NM甲醛总柱浓度产品源自NOAA-20卫星OMPS星下点仪,基于328.5–356.5 nm辐射反演全球日均HCHO柱浓度。空间分辨率12–17 km,覆盖全球,每日约14.5轨,采用netCDF-4格式,支持NASA Earthdata一键检索与下载。

100 0
|
2月前
|

测试一下发文章

测试一下发文章

116 1
|
3月前
|
人工智能 前端开发 物联网
|

历史科普视频的AI自动化生产工作流:从全手动到半自动的工程演进

本文量化历史科普视频制作瓶颈,对比全手动(Stable Diffusion/GPT-SoVITS/Manim等开源栈)与半自动(花生AI为核心)方案。实测混合工作流将单期耗时从29–49小时压缩至10–15小时,效率提升60%+,兼顾质量、可控性与落地性。

643 3
来自: 视觉生产  版块
|
3月前
|
存储 人工智能 编解码
|

AI短剧/AI广告生成实战流程:阿里云百炼新上线的HappyHorse 1.1功能详解、参数调试、成本指南

HappyHorse是阿里云推出的端到端AI视频生成大模型,2026年6月22日正式上线迭代版本HappyHorse 1.1,部署在阿里云百炼平台对外开放API调用与在线调试能力,主打短剧、电商广告、品牌宣传片、内容营销短片四大商用内容场景。相比初代HappyHorse 1.0,新版本在动态时序、角色一致性、画面质感、音画协同、长指令理解五大核心维度完成系统性升级,解决旧版动作僵硬、人物面部失真、多角色画面互相污染、长分镜逻辑断裂等行业常见痛点。

754 2
|
3月前
|
机器学习/深度学习 算法 计算机视觉
|

Ж-CEH:锚定结构存在论—— 从宇宙虚无到视觉张量的统一框架

陈恩华提出“锚定结构存在论”,定义核心算符Ж(观察者坍缩筛)与锚定存在方程,首创Ж-CEH算法,突破强光干扰下边缘检测难题:FP压制率达83%~89%,F1仅降2.3%,1帧恢复。实现工业视觉从“依赖光源”到“遵循物理规律”的范式跃迁。

264 1
|
3月前
|
人工智能 数据可视化 5G
|

一线互联 × Rokid AI眼镜:为什么它是工业4.0时代一线人员的标准装备?

Gartner预测:2027年30%工业企业将为一线员工标配AI眼镜(2023年仅5%)。Rokid灵伴眼镜+一线互联jLink,以轻量化硬件、5G低延时网络与任务驱动型协作系统,实现远程指导、过程留痕、数据归档闭环,助力企业降本增效、沉淀数字资产。(239字)

244 2
|
3月前
|
机器学习/深度学习 数据可视化 测试技术
|

YOLO26如何涨点系列篇(NEU-DET缺陷检测) | CVPR2026 FAAFusion 解决Neck跨尺度方向冲突,实现涨点1.2%

在NEU-DET数据集下验证:原始mAP50原始为 0.722提升至 0.734 ,P 原始为  0.745 提升至   0.749, R 原始为 0.643 提升至0.665 , mAP50-95原始为0.407提升至 0.41

410 3

视觉智能

为开发者提供高易用、普惠的视觉API服务,帮助企业快速建立视觉智能技术应用能力的综合性视觉AI能力平台。适用于数字营销、互联网娱乐、安防、手机应用、泛金融身份认证等行业。

0
今日
12972
内容
3
活动
904
关注
你好!
登录掌握更多精彩内容

相关产品

  • 视觉智能开放平台