计算机视觉

首页 标签 计算机视觉
# 计算机视觉 #
关注
26806内容
|
1月前
|
桑叶病害目标检测数据集:16,000张图像 | 目标检测
本数据集含16,000张高清桑叶病害图像,YOLO格式标注,单类别“病害”,覆盖锈病、褐斑病等多种类型及不同光照、生长阶段与病害程度,专为小目标检测优化,支持YOLOv8等主流模型训练,助力智慧农业病害早发现、精定位。
基于YOLO11的航拍屋顶杂物检测:从数据标注到云上训练全流程实践
本文详解基于YOLO11的航拍屋顶杂物检测全流程:涵盖14001张512×512图像的数据采集、Label Studio标注、云上(OSS)存储与版本管理、针对性训练策略(解决10类目标尺度不均与样本失衡),以及模型评估与工程部署,助力智慧城市精细化巡检。
|
1月前
|
建筑施工现场劳务数字化方案 —— 劳务实名制管理模块详解
智慧工地劳务管理模块依托人脸识别、物联网等技术,实现人员实名制登记、智能门禁、自动考勤、安全教育留痕、特种作业证件预警、区域定位、班组统筹及应急响应等九大功能,推动用工管理数字化、标准化、可追溯。
AI英语考试平台的开发
本项目构建AI驱动的英语考试平台,覆盖智能命题、口语评测、写作批改、AI监考及考后诊断全环节。采用LLM+ASR+CV多模态技术,兼顾CEFR标准、评分可解释性与高并发稳定性,严格保障隐私合规与试题安全,助力雅思/托福等场景智能化升级。(239字)
|
1月前
| |
来自: 视觉智能
Q-CueGraph:你的多模态大模型会 zoom,但真的知道该看哪儿吗?
Q-CueGraph 提出“看哪里”决策外化新范式,通过OCR版面图或开词汇检测构建证据图,精准裁剪仅19%画面,在V*Bench上将冻结Qwen2.5-VL准确率从0.696提升至0.833,揭示zoom价值依赖任务特性,重在可审计、可预算的理性决策框架。(239字)
|
1月前
|
无人机灾害场景人体目标检测数据集:10,000张图像 | 目标检测
本数据集含10,000张无人机航拍灾害场景图像,专用于人体目标检测,覆盖地震废墟、洪水、火灾、城市坍塌等复杂环境,标注精准、结构规范,适配YOLO/RT-DETR等主流框架,助力小目标、强遮挡、多变光照下的应急搜救算法研发与部署。(239字)
基于 YOLO11 的航拍减震器损伤检测:从数据标注到云上训练的全流程实践
本文介绍基于YOLO11的航拍减震器损伤检测全流程实践,涵盖数据标注、云上训练(阿里云ECS/OSS)、模型评估与部署。提供2778张640×640图像数据集(含破损/完好两类),支持YOLO/VOC/COCO格式,适配电力、通信设施智能巡检场景。(239字)
|
1月前
|
抽烟行为目标检测数据集:3,000张图像 | 目标检测
本数据集含3000张高质量图像,专为抽烟行为目标检测设计,覆盖地铁、医院等多场景及复杂光照条件。采用YOLO标准标注(smoke单类),支持行为语义理解与小目标检测,适配YOLOv5/v8,开箱即用,助力智能禁烟监管系统快速落地。(239字)
基于 YOLO11 的车辆品牌 Logo 检测:从数据标注到云上训练工程化实践
本文介绍基于YOLO11的车辆品牌Logo检测工程实践:涵盖31类、5697张图像的数据集构建,从Label Studio标注、云上OSS存储与版本管理,到YOLO11训练调优、小目标增强及多维度评估,实现端到端可复现、可迭代的AI落地流程。(239字)
MiniMax H3 登顶 Hugging Face:视频大模型正在改写软件测试的验收标准
MiniMax正式开源新一代多模态视频生成模型H3,支持文/图/音/视频输入,可生成4–15秒、24FPS、32kHz立体声的高质量视频,并具备首尾帧控制、多参考等能力。其在Artificial Analysis音频视频榜单登顶,引发社区广泛关注。该模型对测试提出全新挑战:需从传统功能验证转向涵盖指令遵循、时序一致性、音画同步、安全合规等七大维度的质量评估体系。
免费试用