|
机器学习/深度学习 Web App开发 算法
|

【天池直播】图像识别系列直播二--进阶:U-Net在CT图像分割中的应用

图像识别系列直播一--入门:适合新人的工程指南为大家普及DL的相关内容,并为大家共享了怎样入门图像识别。 接下来为大家分享图像识别系列直播二:U-Net在CT图像分割中的应用,进阶图像识别! 本次邀请到医疗AI大赛人气奖宜远智能_HKBU团队

4433 3
来自: 图像理解  版块
|
机器学习/深度学习 算法 Linux
|

图像识别DM8127开发攻略 ——板子启动过程

3062 0
来自: 图像理解  版块
|
机器学习/深度学习 人工智能 算法
|

浪潮发布业界最高GPU密度的SR-AI整机柜

2421 1
来自: 文字识别  版块
|
机器学习/深度学习 算法 大数据
|

阿里云智能图像识别服务发布

本文的整理自2017云栖大会-上海峰会上阿里巴巴iDST研究员华先胜,关于智能图像识别服务发布的讲义。从图像识别介绍、到市场分析、再到阿里云解决方案,最后进行了功能展示以及介绍了如何调用服务的方式。

5799 13
来自: 图像理解  版块
|
机器学习/深度学习 数据库 Python
|

利用机器学习技术进行图像识别

3442 0
来自: 图像理解  版块
|
计算机视觉
|

OPENCV图像处理提高(一)图像增强

在图像处理学习中会涉及到直方图,直方图很好地表现了图像的灰度信息;同时我们注意到在暗图像中,直方图的分量集中在灰度级的低端;亮图像的灰度值集中在直方图灰度值的高端;低对比度的图像有较窄的直方图,并集中于直方图的中间部分;高对比度的图像中直方图的分量覆盖很宽的范围,而且像素的分布没有太不均匀,只能看到少量垂线比其他高许多。通过图像增强可以有效地减弱这些缺陷

9462 57
来自: 视觉生产  版块
|
24天前
|
缓存 自然语言处理 文字识别
|

从 3.94 亿页书里捞出 2262 万个视觉元素

本研究提出轻量级视觉元素提取管线,面向哈佛图书馆数亿页古籍扫描,实现插图、乐谱、图表等五类非文本元素的检测、分类、去重与可选描述,最终释放2262万高质量视觉crop,兼顾精度、效率与可审计性。(239字)

77 0
|
26天前
|
文字识别 自然语言处理 数据挖掘
|

把 8300 万个报纸版面单元变成可查询对象

该管线首创“crop-first”范式,将历史报纸页图切分为结构化单元,每个crop附带OCR文本、类型、语言、实体、主题、阅读顺序及向量,支持精准过滤、重建与审计,大幅提升数字人文研究可用性。(239字)

69 0
|
27天前
|
机器学习/深度学习 人工智能 编解码
|

ArmorOCR:模型读出了隐藏文字,但它知道自己在读哪里吗?

ArmorOCR提出“接地式对抗视觉感知”,首创AdvSpot基准,要求模型同步定位文本区域并准确识别内容。通过两阶段训练(特权观察自蒸馏+组内强化学习),将8B模型AdvSpot准确率从31.2%提升至55.7%,推动对抗OCR从“能否读出”迈向“能否证真”。

134 0
|
28天前
|
人工智能 文字识别 自然语言处理
|

35 种开源文档抽取配置,只有 4 个跨过 F1 0.5

在真实公共部门成绩单上,开源零样本结构化抽取远未到可自动化水平;决定成败的不只是模型大小,OCR 是否保留行分组和表格结构同样关键。

106 2
|
29天前
|
缓存 文字识别 前端开发
|

DocClaw:让文档 Agent 记住自己刚刚读过哪里

DocClaw提出统一文档智能框架,将任务差异置于技能层、可复用知识存于状态层、感知动作交给工具层,实现OCR、DocQA与KIE共享交互过程,显著提升多轮查询质量与效率。(239字)

92 0
|
30天前
|
文字识别 自然语言处理 测试技术
|

OmniHandwritingOCR:别让多模态大模型把手写公式读成幻觉

OmniHandwritingOCR 是首个面向手写OCR的细粒度诊断基准,含7.7万图像-标签对、6项子任务与12个子集,聚焦多行公式等难点;首创“事实性标注”,拒绝语义纠错,直击模型幻觉问题。(239字)

135 1
|
30天前
|
缓存 人工智能 边缘计算
|

模型蒸馏实践:Vera1.1 轻量化分支 4K 视频推理性能对比

Vera1.1推出结构化蒸馏轻量分支(S1/S2/INT8),基于双流DiT时空解耦架构,分层知识蒸馏兼顾4K画质与时序稳定性。实测显存降27%–61%,单卡日产能提升至1390段,适配H100/4090/昇腾等多平台,破解AI视频工业化算力瓶颈。

77 0
|
1月前
|

DocMemo:让长文档 RAG 学会带记忆地翻页

DocMemo提出“读-记-更新-再找”循环机制,通过三层记忆(文档结构、页面信念、问题轨迹)显式建模检索状态,用Beta分布与Thompson采样动态更新页面相关性,在长文档RAG中显著提升证据召回率与准确率。

82 0
|
1月前
|
机器学习/深度学习 人工智能 算法
|

宠物犬类品种识别算法开发实操流程,支持180+种狗品种(附测试效果)

在人工智能与生物技术深度融合的今天,犬种识别技术已从实验室走向千家万户。犬种识别可以帮助人们更好地理解和照顾他们的宠物,同时对于遗传疾病的研究、遗失宠物的寻找以及犬只的品种改良等方面也有着重要的作用。本文以快瞳科技宠物犬种识别算法的技术原理、效果展示、代码示例及应用场景为例,从技术原理、测试效果、训练代码、应用场景等四个层面详细拆解犬种识别算法的实操细节,帮忙开发人员快速掌握该算法核心逻辑,落地相关技术方案。若有不足之处,欢迎大家指正。

85 0
来自: 通义万相  版块
|
1月前
|
机器学习/深度学习 人工智能 边缘计算
|

实战:针对幼犬/老犬鼻纹变化的动态特征提取模型优化

在应用宠物犬只鼻纹识别算法时,会面对幼犬和老犬这两个特殊群体,这时我们遇到了经典假设的挑战:鼻纹特征并非完全静态,而是在生命周期中经历着“定型-稳定-退化”的动态过程。当生物特征会“成长”与“衰老”,如何让AI模型具备“时间感知”能力,实现全生命周期精准识别呢?本文以快瞳科技宠物犬只鼻纹识别算法为例,从核心痛点、技术框架、优化案例、技术建议等四个层面详细拆解“如何解决犬种鼻纹动态变化对识别算法的挑战”,帮忙开发人员快速掌握模型优化的核心逻辑,落地相关技术方案。若有不足之处,欢迎大家指正。

89 0
来自: 图像理解  版块
|
1月前
|
JSON 人工智能 文字识别
|

83.85% vs 17.91%:FormStruct-Bench 揭开表单解析的错觉

FormStruct-Bench 是首个面向表单文档的层级化诊断基准,突破传统“字段对错”评测,精准定位区域、网格、字段路径、控件及关系等结构错误层。实测显示:模型内容识别(83.85%)远优于结构恢复(主结构仅17.91%),直击RAG、自动化入库等场景的核心痛点。

73 0
|
1月前
|
数据采集 编解码 文字识别
|

DEC:别急着重训,先让表格解析器再检查一遍

这篇论文直击文档解析痛点:高分OCR在真实复杂表格中仍频出错。作者构建TableParseMap诊断基准,提出DEC框架——不重训模型,而是通过分解、增强、修正三步外挂式修复,为冻结/闭源解析器提供工程化补丁方案。(239字)

105 0
|
1月前
|
人工智能 安全 数据安全/隐私保护
|

喂张白纸也能吐出证件号?文档 MLLM 的"关系级泄露"被测出来了

该文揭示文档多模态大模型在图像模糊/缺失时,会凭记忆成组泄露姓名、证件号等关联敏感信息(最高泄露率95.5%),首创动态关系遗忘框架DRUF,实现泄露风险趋零且不损正常抽取能力,为KYC等高敏场景提供可落地的隐私防护新范式。(239字)

72 1
|
1月前
|
机器学习/深度学习 人工智能 文字识别
|

1.2B 小模型赢过 235B 大模型:NaviDC-OCR 把文档解析卷明白了

NaviDC-OCR是中国电信AI团队推出的轻量级(1.2B)文档解析模型,专注解决手机拍摄文档的畸变、弯曲、透视等真实场景难题。它首创形变感知训练与边界点序列检测,结合内容-结构解耦学习,在OmniDocBench等四大基准全面登顶,小模型大幅超越Qwen3-VL、GPT-5.2等百B级通用大模型,为RAG与文档智能提供高鲁棒性“地基”。

197 0
|
1月前
|
人工智能 文字识别 算法
|

AutoDesign:让 Agent 自己改自己的 harness,40 分钟把论文变成会议海报

AutoDesign提出“元挽具优化”,将Agent的prompt、工具、流程等系统组件作为自动进化对象:外层循环优化系统,内层循环生成作品,模型权重不变。在论文转海报任务中,超越Claude Design 7.45分,验证了“弱模型+强系统”的高性价比路径。(239字)

131 1
|
1月前
|
机器学习/深度学习 机器人 定位技术
|

视频生成得很真,机器人却抓了个寂寞:DreamX-Phi 的几何药方

DreamX-Phi 1.0 创新性地将机械臂3D运动轨迹(SE(3))直接嵌入注意力机制(PRoPE),解决视频世界模型“画面真、动作错”的核心痛点,在WorldArena 2.0视频预测赛道夺冠,兼具几何精度与推理轻量性。

106 0
|
1月前
|
机器学习/深度学习 人工智能 缓存
|

Grok 4.6:追平 GPT-5.6 Sol 的半价旗舰,但别只看跑分

Grok 4.6是xAI于2026年8月发布的1.5万亿参数大模型,专注长程智能体任务,AI指数61分追平GPT-5.6 Sol;回合效率领先(仅需53步),定价$2/$6(百万Token),但超20万Token即翻倍。

722 0
|
1月前
|
人工智能 缓存 API
|

DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说

DeepSeek V4-Pro正式版(0813)上线,Agent能力跃升:DeepSWE达62.7(+5×),Terminal Bench 87.9,逼近Claude Fable 5;输入3元/百万Token、输出6元,成本仅其约1/46,但所有跑分尚未经第三方验证。

512 0
|
1月前
|
机器学习/深度学习 人工智能 文字识别
|

延迟只多 0.8 毫秒,检索质量涨 2.92%:抖音 DME 怎么让多模态检索又快又准

抖音搜索团队提出DME方法,创新性采用“隐式潜推理+跨条件重建”双阶段训练机制,在不增加推理延迟前提下显著提升多模态嵌入的细粒度判别力;首创acc@K指标量化嵌入信息完备性,实现在MMEB-v2等评测中SOTA表现。(239字)

224 3
|
1月前
|
存储 人工智能 缓存
|

把 AI 视频编辑器搬进浏览器:多轨时间线、WebGPU 与媒体同步的工程实践

本文介绍开源浏览器AI视频编辑器Timeline Studio的v1.0.2重构实践:聚焦多轨时间线稳定性、项目/媒体时间精准同步、WebGPU高性能适配、AI Worker模型缓存与复用等核心工程挑战,推动网页端视频创作从Demo走向可靠生产。

64 0
|
1月前
|
编解码 文字识别 定位技术
|

Q-CueGraph:你的多模态大模型会 zoom,但真的知道该看哪儿吗?

Q-CueGraph 提出“看哪里”决策外化新范式,通过OCR版面图或开词汇检测构建证据图,精准裁剪仅19%画面,在V*Bench上将冻结Qwen2.5-VL准确率从0.696提升至0.833,揭示zoom价值依赖任务特性,重在可审计、可预算的理性决策框架。(239字)

80 0
|
1月前
|
机器学习/深度学习 文字识别 前端开发
|

Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体"不会做题"了

这篇2026年新论文揭示:多模态大模型“能读出图中题目”不等于“会照它执行”。作者通过VTS控制实验确证“读≠用”的本质鸿沟,并提出region级prompt-region grounding训练法,在不依赖OCR、不增推理开销下显著缩小差距。(239字)

271 0
|
1月前
|
机器学习/深度学习 敏捷开发 传感器
|

20260809062836_flowpilot-uav-wam

FlowPilot 是一种轻量级生成式世界-动作模型,首次将“未来场景预测”与“平滑轨迹生成”耦合于单模型中,在Jetson Orin NX上实现<18ms端到端推理,助力四旋翼在未知森林中以5.5m/s高速自主避障。

121 1
|
1月前
|
文字识别 数据安全/隐私保护 C++
|

ConfBench:大模型的「我很有把握」,到底能不能信?

ConfBench 用受控退化造出一份「低精度区」基准,首次系统测出 VLM 在文档提取时自报的置信度能不能信,还给了 ECARB 这个能直接算「省多少人工审核」的指标——做文档智能 / IDP 的人值得读。

113 1
|
3月前
|
人工智能 物联网 API
|

Rokid AI 眼镜远程协作应用"一线互联"开发实践:设备发现与 BLE 扫描

工业现场蓝牙扫描远非简单“搜到即连”:需两级过滤(系统低延迟扫描+应用层UUID/名称匹配)、RSSI智能排序、MAC地址临时命名,并通过CXR私有协议建立专用连接,确保秒级稳定接入。

216 0
|
对象存储
|

通过非上海oss链接请求阿里云人脸修复增强接口

在使用阿里云视觉智能开放平台时,除了使用oss链接调用接口,也可以通过本地图片流的方式调用接口

878 0
来自: 人脸人体  版块
|
机器学习/深度学习 数据可视化 测试技术
|

YOLO26如何训练自己的数据集 | (NEU-DET为案列)

本文详解YOLO26全新架构:移除DFL、端到端无NMS推理、ProgLoss+STAL损失策略及MuSGD优化器;并以NEU-DET数据集为例,详述训练全流程(含预训练/优化器选择/模型缩放对比),附结构图、代码与可视化结果。

616 1
|
决策智能 机器人 数据可视化
|

CEH-Flow-Perception:一种基于双场时空耦合的实时物理驱动动态避障方法 - 陈恩华

本文提出CEH-Flow-Perception方法,首创双场(导通场+学习场)时空耦合势场模型,将动态障碍建模为具短期响应与长期记忆的连续物理场,实现无显式路径规划的实时避障。端到端延迟 33ms,支持遮挡记忆、多智能体协同与可解释因果追溯。

280 4
来自: 视觉生产  版块

视觉智能

为开发者提供高易用、普惠的视觉API服务,帮助企业快速建立视觉智能技术应用能力的综合性视觉AI能力平台。适用于数字营销、互联网娱乐、安防、手机应用、泛金融身份认证等行业。

0
今日
12975
内容
3
活动
904
关注
你好!
登录掌握更多精彩内容

相关产品

  • 视觉智能开放平台