视觉智能开放平台

首页 标签 视觉智能开放平台
Sa2VA:别再用PS抠图了!字节跳动开源Sa2VA:一句话自动分割视频,连头发丝都精准
Sa2VA 是由字节跳动等机构联合推出的多模态大语言模型,结合 SAM2 和 LLaVA 实现对图像和视频的精确分割和对话功能。
|
10天前
| |
来自: 视觉智能
DocClaw:让文档 Agent 记住自己刚刚读过哪里
DocClaw提出统一文档智能框架,将任务差异置于技能层、可复用知识存于状态层、感知动作交给工具层,实现OCR、DocQA与KIE共享交互过程,显著提升多轮查询质量与效率。(239字)
阿里云市场通用混贴票证识别接口介绍
阿里云市场有很多文字识别相关服务,通用混贴票证识别接口功能强大目前支持火车票、飞机行程单、出租车发票、定额发票、增值税发票、身份证正面、身份证反面、行驶证正面、机动车登记证、行驶证反面、银行卡、驾驶证正面、卷票、户主页、常住人口页15种票据的检测识别 下面测试下身份证反面的
AIGC图像分辨率太低?快来试试像素感知扩散超分模型,你想要的细节都在这里
阿里巴巴最新自研的像素感知扩散超分模型已经开源,它把扩散模型强大的生成能力和像素级控制能力相结合,能够适应从老照片修复到AIGC图像超分的各种图像增强任务和各种图像风格,并且能够控制生成强度和增强风格。这项技术的直接应用之一是AIGC图像的后处理增强和二次生成,能够带来可观的效果提升。
免费试用