基于YOLOv8的盲道障碍检测系统

简介: 基于 YOLOv8 深度学习模型与 PyQt5 桌面框架构建,旨在实时检测盲道上的常见障碍物,为视障人士的出行安全提供辅助。系统提供直观的可视化操作界面,支持图片、视频文件和实时摄像头三种检测模式,并集成了完整的用户认证与历史记录功能。

基于 YOLOv8 深度学习模型与 PyQt5 桌面框架构建,旨在实时检测盲道上的常见障碍物,为视障人士的出行安全提供辅助。系统提供直观的可视化操作界面,支持图片、视频文件和实时摄像头三种检测模式,并集成了完整的用户认证与历史记录功能。


主要功能

用户认证系统

  • 登录 / 注册:支持用户名与密码的账号体系,密码经 SHA-256 加密后存储于本地 users.json
  • 找回密码:通过安全问题验证身份后重置密码(需注册时设置安全问题)。

多模式障碍物检测

  • 图片识别:上传单张图片,系统识别后以标注图和详情表格(类别、置信度、坐标)的形式展示结果,支持一键保存。
  • 视频识别:逐帧处理本地视频文件,实时显示检测画面、用时、目标数量及进度条。
  • 摄像头识别:调用本地摄像头进行实时画面捕捉和障碍物检测,支持多设备切换。

历史识别记录

  • 每次完成图片、视频或摄像头识别后,系统自动将识别时间、来源类型、文件名、目标数量和用时写入本地 history.json
  • 在"历史记录"页面可查看所有记录(按时间倒序排列),支持刷新删除选中清空全部操作。

可视化界面

  • 浅色渐变主题:默认采用清爽的蓝色渐变主题,同时内置深蓝、绿色、橙色等多种主题可切换。
  • 左侧导航栏:在图片识别、视频识别、摄像头识别、历史记录四个模块间快速切换。
  • 自动加载权重:启动时自动寻找 runs/train/ 下最新的 best.pt,也支持手动选择。

支持识别的障碍物类别(共 16 种)

英文标签

中文名称

英文标签

中文名称

blind track

盲道

pole

立杆

ashcan

垃圾桶

fire_hydrant

消防栓

car

汽车

stop_sign

停止标志

bicycle

自行车

truck

卡车

person

行人

dog

spherical_roadblock

球形路障

motorbike

摩托车

warning_column

警示柱

bus

公交车

tricycle

三轮车

reflective_cone

反光锥


🛠️ 技术栈

类别

技术

深度学习模型

Ultralytics YOLOv8

深度学习框架

PyTorch

图形用户界面

PyQt5

图像处理

OpenCV-Python

数值计算

NumPy


📁 文件结构

├── gui.py                # 主程序 GUI 界面与核心推理逻辑
├── login.py              # 登录、注册、找回密码模块
├── theme.py              # 主题管理器(浅色渐变 / 深蓝 / 绿色 / 橙色)
├── history_manager.py    # 历史识别记录读写管理
├── train.py              # 模型训练脚本
├── requirements.txt      # Python 依赖清单
├── users.json            # 用户数据库(运行后自动生成)
├── history.json          # 历史记录数据库(运行后自动生成)
├── data/                 # 数据集目录
│   └── data.yaml         # 数据集配置文件
└── runs/                 # YOLOv8 训练 / 推理输出目录
    └── train/
        └── blindtrack_detection/
            └── weights/
                └── best.pt   # 训练好的最优权重(自动加载)

🚀 快速开始

1. 环境准备

  • Python 3.8+
  • (可选但推荐)NVIDIA 显卡 + CUDA,用于 GPU 加速推理

2. 安装依赖

# 建议先创建虚拟环境
python -m venv venv
venv\Scripts\activate        # Windows
# source venv/bin/activate   # Linux / macOS
pip install -r requirements.txt

3. 准备模型权重

  • 自动加载:将训练好的权重目录(含 best.pt)放在 runs/train/ 下,启动时自动识别最新权重。
  • 手动选择:在"图片识别"页面点击"选择权重"按钮手动指定 .pt 文件。

4. 启动程序

python gui.py

首次运行会弹出登录窗口,请先注册账号再登录。


📖 使用指南

用户认证

  1. 点击"注册账号",填写用户名(≥3字符)和密码(≥6字符)完成注册。
  2. 登录后进入主界面。

图片识别

  1. 确认顶部权重路径已加载(或手动选择 best.pt)。
  2. 调整置信度阈值(默认 0.25)。
  3. 点击"打开图片",选择图片后系统自动检测。
  4. 右侧面板展示目标列表;点击"保存结果"导出标注图。

视频识别

  1. 点击"选择视频"选择 .mp4 / .avi / .mov / .mkv 文件。
  2. 点击"开始"逐帧检测,进度条实时更新;点击"停止"终止。
  3. 识别结束后自动写入历史记录。

摄像头识别

  1. 点击"刷新设备"扫描可用摄像头并在下拉列表中选择。
  2. 点击"开始"进行实时检测;点击"停止"结束并写入历史记录。

历史记录

  • 点击左侧导航"历史记录"可查看所有历史。
  • 支持选中行后点击"删除选中",或"清空全部"一键清除。

📊 模型训练

使用 train.py 对自定义数据集进行训练:

python train.py

训练完成后,结果输出至 runs/train/ 目录,包含以下关键文件:

文件

说明

weights/best.pt

验证集上表现最优的权重,供推理使用

results.csv / results.png

各 epoch 的损失、精确率、召回率、mAP 变化曲线

confusion_matrix.png

混淆矩阵,对角线越亮分类越准确

PR_curve.png

精确率-召回率曲线,曲线下面积越大越好

F1_curve.png

F1 分数曲线,用于寻找最优置信度阈值

labels.jpg

数据集类别与标注框分布可视化

val_batchN_pred.jpg

验证集批次预测效果直观展示


本项目为个人原创,结构清晰,功能完整,适合计算机视觉方向课程设计、毕业设计和项目演示使用。有定制化需求可以评论或私信作者。

目录
相关文章
|
8天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2188 12
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
8天前
|
云安全 人工智能 安全
|
8天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
989 1
|
10天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
992 44
|
8天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
1004 0
|
7天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
488 1
|
10天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
690 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南