在智能终端、工业质检、显示模组装配、AR/VR 标定等场景中,屏幕角点定位是实现图像校正、尺寸测量、姿态估计和自动化引导的关键环节。Yolo-ArbV2 作为在 YOLOv5 基础上二次开发的多边形检测算法,能够在保留目标框检测能力的同时,输出目标多边形的角点信息,因此成为屏幕定位领域的重要工具。
然而,现实拍摄环境并不总是理想。屏幕可能只有部分出现在画面中,尤其是只缺失一个角的情况非常常见。传统 Yolo-ArbV2 方法更适用于完整屏幕场景:当屏幕角点位于图片之外时,坐标会变成负值,而 YOLOv5 体系中的预处理、批归一化和损失计算通常要求标签数据归一化到零到一之间。负坐标无法直接参与训练,模型也就难以准确预测缺失角点。
针对这一痛点,合肥高维数据技术有限公司、中国科学技术大学提出一种用于全屏或单角缺失的屏幕角点定位方法(申请号:2023105280811,专利名称:用于全屏或单角缺失的屏幕角点定位方法)。其核心思路非常巧妙:先把缺失角点“请进”图片内部,再让模型正常学习,最后在推理阶段把预测结果“放大还原”到真实尺度。通过这一闭环,模型不仅适用于完整屏幕,也能在单角缺失情况下实现全部屏幕角点的准确定位。
核心方案:先缩小补零,再放大还原
该方法首先构建缺失角点数据集。具体来说,对包含完整屏幕的原图进行裁剪,得到单角点缺失图。裁剪时,可以人工标记完整屏幕的四个角点,任意选择一个角点作为缺失角点,再通过几何分割方式裁掉该角点,同时保留其余三个角点。这样得到的单角点缺失图中,缺失角点位于图片之外。
随后,对单角点缺失图进行中心缩小处理,并在四周填补零像素,使图片长宽保持不变。由于进行了中心缩小,原本位于图片外的缺失角点,会被纳入四周填补的区域内。这样,原本可能为负值的角点坐标,经过缩放和补零变换后变成正值,再根据缩小补零后的图片长和宽,将角点坐标归一化为零到一之间的标签值。
这一步看似简单,却精准解决了 Yolo-ArbV2 训练中的关键障碍:不在原始图片内的角点,也能拥有合法、可训练的归一化标签。
在数据集构建完成后,采用 Yolo-ArbV2 模型进行训练。训练时,单角点缺失图作为模型输入,经过缩小补零后计算得到的标签值作为模型输出。模型在常规训练过程中,能够正常计算损失并反向传播优化,不再因为缺失角点坐标为负而失效。
当模型训练完成,进入实际推理阶段时,将待识别的全屏或单角缺失图片输入训练好的角点识别模型,得到预测标签值。随后,对预测标签值进行中心放大处理和坐标变换,还原出真实角点坐标。中心放大处理是中心缩小的逆过程,以图像中心为基准,将预测标签值恢复到缩小前的尺度;再根据待检测图片的宽和高,换算出真实像素坐标。中心放大处理与坐标变换的步骤不分先后,甚至可以穿插进行,实际应用中可根据计算流程灵活安排。
三大亮点:兼容、精准、可调
本发明的流程示意图
第一,兼容现有 Yolo-ArbV2 框架。
该方法没有推翻原有网络结构,而是在数据构建、标签生成和推理后处理环节进行创新,能够与现有 Yolo-ArbV2 检测流程顺畅结合,降低迁移和部署成本。
第二,让缺失角点参与训练。
通过中心缩小和补零占位,缺失角点从“无法标注的负坐标”变成“可归一化的正标签”,从而正常参与损失计算和反向传播,提升模型对缺角屏幕的定位能力。训练时输入的是单角点缺失图,标签来自缩小补零后的图像;推理时输入可以是全屏或单角缺失图,输出经过逆变换还原,形成完整闭环。
第三,参数可调,平衡精度与容忍度。
该方法中设置了预设的缩小系数和对应的放大系数,两者互为倒数。放大系数大于一且小于三。放大系数越接近一,角点预测精度越高,但可容忍的单角缺失区域越小;放大系数越接近三,可容忍的缺失区域越大,但精度可能有所下降。用户可根据实际使用场景灵活设置,兼顾鲁棒性与准确性。
应用前景广阔
局部拍屏溯源:面向国防军工、党政机关、涉密科研院所和重点企事业单位,缺角拍屏仍可还原屏幕几何,为水印同步提供定位基准,补强高维数据摄猎®系统在局部拍屏场景下的溯源能力。
视频会议安全:面向党政机关、军工集团、金融能源企业、远程协作与跨域会议行业,在屏幕共享、窗口裁剪、画面缩放等缺角条件下稳定定位,提升会议录制、审计和泄密溯源中的屏幕边界识别与校正能力。
智能检测装备:面向显示面板、半导体、智能制造、机器视觉和屏幕安全管控装备行业,可嵌入检测设备或安全管控终端,增强复杂拍摄条件下的适应性,协同高维数据智能装备制造业务。
AI认知安全与数据治理:面向政务数据、金融数据、能源交通、数据交易所、AI安全与深伪检测行业,为屏幕内容取证、篡改检测、数据确权和跨域治理提供几何一致性依据,协同高维数据认知对抗与数据要素治理业务。