通义妙谈 -图像模型玩转更多可能!通义万相新升级 一个包罗万象的“应用广场”!
“买家秀”秒变“卖家秀”,AI一键更换商品模特,虚拟模特功能等你解锁🔒 “小草图”秒变“大制作”,AI涂鸦作画让你的草图“一秒”成画🖌️ “2-4图”生成“个人写真”,AI虚拟分身在线创作,在家也是巴厘岛🏖️ 阿里云的微博视频 全网征集灵魂画手,几笔生成精美大作,精美礼物等你来拿
通义妙谈-阿里云图像生成大模型通义万相,Composer算法实现绘图精准可控
通义妙谈-阿里云图像生成大模型通义万相,Composer算法实现绘图精准可控
facechain人物写真生成工业级开源
facechain人物写真应用自8月11日开源了第一版证件照生成后。目前在github(GitHub - modelscope/facechain: FaceChain is a deep-learning toolchain for generating your Digital-Twin.)上已有5.7K的star,论文链接:FaceChain: A Playground for Identity-Preserving Portrait Generation:https://arxiv.org/abs/2308.14256。
【IJCAI 2023】流感知优化之 DAMO-StreamNet 论文解读
传统视频目标检测(Video Object Detection, VOD)是离线(offline)的检测任务,即仅考虑算法的检测精度,未考虑算法的延时。流感知(Streaming Perception)任务作为VOD的一个细分方向,采用流平均精度(Streaming Average Precision, sAP)指标,衡量算法的在线(online)检测能力,即同时衡量算法的精度和延时。本文针对现有的流感知工作在训练方式和模型感受野两方面的不足,提出了DAMO-StreamNet,在保证算法实时性的前提下,实现了SOTA的性能。
ChatGPT最强专业学习资料集锦
本文旨在整理一份可供参考和学习的专业ChatGPT相关资料,包括ChatGPT相关论文、Github项目、以及当前市场上出现的ChatGPT相关产品等。
【阿里云OpenVI-人脸感知理解系列之人脸识别】基于Transformer的人脸识别新框架TransFace ICCV-2023论文深入解读
本文介绍 阿里云开放视觉智能团队 被计算机视觉顶级国际会议ICCV 2023接收的论文 "TransFace: Calibrating Transformer Training for Face Recognition from a Data-Centric Perspective"。TransFace旨在探索ViT在人脸识别任务上表现不佳的原因,并从data-centric的角度去提升ViT在人脸识别任务上的性能。
【阿里云OpenVI-视觉生产系列之图片上色】照片真实感上色算法DDColor ICCV2023论文深入解读
图像上色是老照片修复的一个关键步骤,本文介绍发表在 ICCV 2023 上的最新上色论文 DDColor
AIGC视频生成/编辑技术调研报告
随着图像生成领域的研究飞速发展,基于diffusion的生成式模型取得效果上的大突破。在图像生成/编辑产品大爆发的今天,视频生成/编辑技术也引起了学术界和产业界的高度关注。该分享主要介绍视频生成/编辑的研究现状,包括不同技术路线的优劣势,以及该领域当下面临的核心问题与挑战。
AIGC玩转卡通化技术实践
伴随着持续不断的AIGC浪潮,越来越多的AI生成玩法正在被广大爱好者定义和提出,图像卡通化(动漫化)基于其还原效果高,风格种类丰富等特点而备受青睐。早在几年前,伴随着GAN网络的兴起,卡通化就曾经风靡一时。而今,伴随着AIGC技术的兴起和不断发展,扩散生成模型为卡通化风格和提供了更多的创意和生成的可能性。本文就将详细介绍达摩院开放视觉团队的卡通化技术实践。
AIGC图像分辨率太低?快来试试像素感知扩散超分模型,你想要的细节都在这里
阿里巴巴最新自研的像素感知扩散超分模型已经开源,它把扩散模型强大的生成能力和像素级控制能力相结合,能够适应从老照片修复到AIGC图像超分的各种图像增强任务和各种图像风格,并且能够控制生成强度和增强风格。这项技术的直接应用之一是AIGC图像的后处理增强和二次生成,能够带来可观的效果提升。
OpenVI-感知理解系列之GAP骨骼点动作识别 ICCV23顶会论文深入解读
本文介绍了ICCV23中稿论文 GAP: Generative Action Description Prompts for Skeleton-based Action Recognition
本地生活技术雷达——生成式AI(Generative AI)在阿里本地生活的应用与思考
本地生活技术雷达是由本地生活技术中心战略管理&PMO团队开展的,定期扫描和评估新兴技术的战略研究工作。目的是对技术趋势进行前瞻性预判,提出新技术布局建议,在技术驱动业务创新和业务增长、践行社会责任等方面有一些实质性探索。 本篇尝试探讨 1)理解AI范式——从分析型(Analytical AI)到生成式(Generative AI)的拐点在2022年,其对人类社会以及商业模式的长期影响; 2)生成式AI(文生文、文生图、图生图等)在本地业务目前场景的应用和未来的方向。 欢迎技术、产品、运营、战略、管理层、国内国际等各种视角的指点和碰撞!
AI产品广告怎么做?15秒时间轴JSON和光、镜头、节奏验收表(2026)
本文回答:一条 15 秒的 AI 产品广告怎么按秒写成时间轴 JSON(起止时间、景别、运镜、主光方向、转场),时间轴里的秒数怎么变成生成参数和剪辑入点,每一镜的提示词怎么从字段拼出来,以及光、镜头、节奏三项质感怎么逐条验收。
ai写短剧剧本怎么做?输入JSON、输出格式约束与11条机器校验规则
本文回答:ai写短剧剧本怎么做——输入 JSON 放哪些字段(人物状态、场戏清单、集末钩子),提示词怎么锁死输出格式,11 条能由程序判定的校验规则各查什么、怎么判,校验不通过怎么只回传规则号和位置做定点返修,以及写完一集怎么把状态增量回写成下一集的输入。
AI短剧制作成本怎么算?抽卡系数、生成秒数的估算公式与Python函数(2026)
本文回答:制作一部ai短剧多少钱怎么算——把预算写成集数、段长清单、单段时长范围、剪辑余量、抽卡系数、返工率、单价、固定项 8 个参数的估算模型,给出三层公式、可直接运行的 Python 估算函数、试做一集的逐次生成日志与抽卡系数计算、预算配置 YAML,以及开样片模式时公式怎么改;不写任何平台单价。
产品视频拍摄缺镜头怎么补?AI补镜任务单YAML与对齐验收表(2026)
本文回答:产品视频拍摄收工后发现缺镜头时,哪些镜头适合用 AI 补、哪些要回棚;补镜要从实拍里准备哪些输入(截帧、参考照片、光向、景别、画幅);一份可照填的补镜任务单 YAML 和对应的提示词写法;补出来的镜头按哪七项和实拍对齐验收;混剪成片上架前要核的平台规则。
产品展示动画怎么做?商品照片转分镜JSON、生成参数与判废表(2026)
本文回答:产品展示动画怎么做——几种做法各要喂进去什么、拿回来什么;AI 从商品照片生成这条路怎么把整条片写成分镜 JSON(商品朝向、运动、时长、背景、参考照片),字段怎么变成每一镜的生成任务和提示词,出片后按哪张判废表逐镜筛,以及已有三维模型时白模视频怎么接进分镜。
AI短剧剪辑怎么制作?片段命名正则、剪辑清单JSON与导出前核对清单
本文回答:ai短剧剪辑怎么制作——生成片段按剧、集、场、段、版本命名并用正则批量校验,每集一份剪辑清单 JSON 逐段登记选用版本、入点出点、字幕行和配音文件,延长片段接缝怎么按帧数落到入点出点上,声音字幕怎么登记,以及导出前按核对表逐项检查实测时长、编码、别家水印和每集 AI 生成提示标识。
AI短剧制作工作流怎么搭?9份产物的依赖表与改稿失效规则
本文回答:ai短剧制作工具和工作流——把一集 AI 短剧拆成 9 份有依赖关系的产物,每份吃进哪些上游字段、交出哪些字段;依赖关系怎么写成 YAML 配置并用版本号判定待复核;上游改了台词、外观、地点、画风等 10 类改动时,哪些下游作废、哪些复核、哪些不动;改稿后失效怎么一层层传下去;几种做法分别由谁维护依赖;出片前的依赖完整性校验清单。
短剧剧本和长剧剧本的区别是什么?8处不同与AI续写的故事档案结构(2026)
本文回答:短剧剧本和长剧剧本的区别——单集长度、开场、结构、节奏、人物、场景、台词、写作流程8处不同,短剧每集的节拍怎么排,用AI写短剧剧本怎么维护故事档案,长剧编剧转写短剧的5个常见错误,以及长剧剧本怎么改成短剧。
AI真人头像生成实践:参考图规范与提示词模板详解
想让AI画出“像自己”的头像?关键不是提示词,而是**一张拍对的参考图**!本文详解5条拍摄规范、两段式提示词结构(身份锁定+场景替换)、4套可直接套用的模板(职场/社交/动漫/古风),并指出80%翻车源于参考图不合格。实操性强,240字内搞定AI真人头像。
2026拆零拣选三维资产库构建:料箱商品标签、碰撞与样例验收
电商仓或即时零售仓做机器人拆零拣选训练时,料箱和刚性商品需要从真实样件变成可识别、可编辑、有碰撞关系的三维对象。核心不是快速生成大量模型,而是让每个资产都能和真实商品清单、类别标签、几何尺寸与任务属性一一对应。
2026超市三维场景适配Isaac Sim:资源引用、碰撞配置与运行检查
超市已经有三维场景,导入Isaac Sim后却可能出现贴图丢失、货架尺寸错位、商品穿透地面,或机器人被看不见的碰撞边界挡住。这类问题通常发生在资源引用、尺寸坐标、对象组织和碰撞配置四个层面。
一个短剧剧本能卖多少钱?平台稿酬区间、4种计价方式与卖稿渠道(2026)
本文回答:一个短剧剧本能卖多少钱——保底加分成、纯分成、买断、按集约稿四种计价方式怎么算,剧本投给谁、要准备什么材料,平台公开过的剧本稿酬区间(现行版与旧版),影响价格的五个因素,以及要不要先做作品登记。
GEO 内容发布前,怎样检查事实依据与审核版本.
本文提出GEO内容事实核查流程:聚焦产品参数、服务承诺等具体主张,拆分验证项并绑定型号、地域、时效及证据;强调版本关联、来源追溯与状态管理;强调人工核验不可替代,避免以发布量掩盖错误。非已落地方案。(239字)
宠物友好社区智能门禁:猫狗识别算法应用与技术实现
随着现代家庭中宠物角色的转变,它们不仅是宠物,更是家庭成员。传统的宠物门(如 flap door)存在破坏门体、保温性差、无法控制进出对象等痛点,基于猫狗识别算法的智能门禁系统,为宠物提供了一种更智能、安全、自主的通行解决方案。本文将深入介绍该技术的核心原理、实现挑战及其应用价值,也结合宠物AI算法解决方案探讨如何应对技术真正落地遇到所遇到的问题,希望能给各位开发者一些帮助。若有不足之处,还望指正。
AI短剧赛道冰火两重天:创作者暴增但变现率暴跌
AI短剧半年从风口到过剩:创作者暴增13倍,人均收入却暴跌超80%。本文用纯Python标准库模拟12个月数据,直观呈现“产量飙升、收益塌方”的剪刀差困局,揭示流量红利摊薄下的生存真相。(239字)
医疗票据OCR与理赔规则自动化:从信息孤岛到智能审核的全链路技术解析
在商业医保与TPA理赔业务中,票据信息提取低效、规则适配脱节、数据标准混乱,长期制约着理赔时效与风控精度。本文从技术视角拆解OCR+知识图谱+规则引擎的融合方案,以快瞳医疗OCR的应用为样本,并附常见实施问题解答,助力企业构建可落地的智能化理赔底座。
企业 Agent 引用投标资料前,如何增加来源、版本和有效性门禁
企业 Agent 引用旧投标资料时,应把来源、版本、有效期、责任人和复核状态作为入库门禁,并通过可复用、待复核、禁止复用三态控制引用与异常回退。
Unity接入EasyAR Mega的发布前自检:用Editor脚本排查五类配置问题
提供一个可直接放入Unity项目的Editor自检脚本,排查EasyAR Mega接入中的插件包、Android构建配置、License与包名、服务权限及Block层级问题。