机器视觉OCR:无需训练数据读取零件标记

字符识别是唯一一种AI方法减少工作量而非增加工作量的检测任务。其他任何类型的AI检测都要先采集并标注零件图像。OCR不需要。模型一开始就已经知道字母和数字长什么样,因为字母和数字在您的产线上和其他任何地方都是一样的。
这一点对项目计划的改变,远大于对技术本身的改变。以下是它在实际应用中的含义,以及它无法解决的问题。
为什么OCR不需要训练图像
分类或分割模型必须专门针对您的零件进行训练,因为您铸件上的划痕和别人挤压件上的划痕完全不同。该模型对两者都没有先验概念。
文本则不同。字形在各行各业中是通用的,因此一个仅用海量文本训练一次的模型可以直接迁移使用。在OV80i中,产品本身将OCR模块描述为能够识别"印刷文本、序列号和其他字母数字文本,无需任何训练数据"。您只需框选文本出现的区域,系统就会读取其中的内容。
实际的结果是,OCR跳过了通常主导视觉项目进度的两个步骤。既不需要图像采集活动,也不需要标注。原本需要两周样本采集才能完成的读取任务,如今只需一个下午框选一个区域即可完成。
您省去的步骤
采集代表性零件、标注字符、等待足够的缺陷样本、在出现新零件编号时重新训练。这些都不适用。即便是产线从未生产过的零件编号,也能正确读取。
您仍需要做的事
选好光学系统和光照,设置区域,调整两个检测参数,并确定通过规则的比较依据。这部分工作不会消失,也正是OCR项目成败的关键所在。
它与传统OCR的区别
传统机器视觉字符识别依靠模板匹配来实现。您需要用特定字体、特定尺寸的每个字符形状来训练系统,系统再将候选区域与该模板库进行比对。这种方式速度快、结果确定,但完全缺乏灵活性。
只要一切不变,缺乏灵活性倒也无妨。可一旦有变化就麻烦了:新供应商压印的字体略有不同;模具磨损导致字符笔画变细;零件送来时旋转了几度。每一种情况都要么需要重新训练模板库,要么导致误读,而在可追溯性检查中出现误读代价高昂,因为该零件会被错误地记录成别的东西。
| Situation | Template OCR | AI OCR |
|---|---|---|
| 新字体或新供应商 | 需要重新训练字符库 | 直接读取,无需改动 |
| 笔画磨损或变细 | 置信度下降,出现误读 | 性能逐渐下降,但容忍度更高 |
| 零件在夹具中发生旋转 | 需要先进行对齐 | 可应对适度旋转 |
| 铸造、刻蚀或打点标记 | 困难,低反差使模板匹配失效 | 配合适当光照即可实现 |
| 固定字体、印刷清晰、大批量 | 效果出色,且更经济 | 同样表现良好,但没有优势 |
最后一行很关键。如果您要读取的是印在平整标签上、字体固定、清晰锐利的喷墨字符,传统OCR已经解决这个问题三十年了,没有理由更换方案。AI OCR的价值体现在那些棘手的标记上:铸造在金属中的字符、镜面表面上的激光刻蚀字符、打点标记,或印刷在曲面或有纹理基材上的字符。

光照仍然决定成败
去除训练数据这一要求,并不能改变物理规律。模型只能读取图像中实际存在的反差,而在凸起或刻蚀的标记上,根本没有颜色差异可供利用。字符和表面是同一种材料,能利用的只有形貌起伏。
这使得光照几何形式成为整个问题的关键。漫射光会把刻蚀标记完全冲淡,因为它会像照亮周围表面一样均匀地照亮字符的凹陷部分。定向光或暗场布光则会掠过表面,把每个字符的边缘变成阴影,这正是模型可以利用的反差。我们关于 机器视觉光照 介绍了六种光照几何形式,以及如何根据需要观察的特征来选择其中一种。
分辨率是第二个约束条件。一个行之有效的经验法则是,让最小字符的高度至少达到二十个像素。低于这个数值,笔画细节就会开始丢失,相似字形之间的区分,比如8与6,或5与S,就会变得模糊不清。我们的 光学计算器 可以根据字符高度和工作距离,计算出实现该效果所需的视场和镜头。
调优,以及两个至关重要的参数
OV80i上的OCR区域以简明易懂的语言呈现检测参数,而不是需要您反向推导的阈值。其中两个参数承担了大部分工作。
最小文本区域
按尺寸筛选候选区域。产品本身直接说明:如果噪点被误判为文本,就调大该值;如果小号文本被过滤掉,就调小该值。这是用于应对带斑点、铸造纹理或加工痕迹的表面的控制项,这些痕迹可能会被识别为微小字符。
扩展比例
控制每个检测到的文本区域向外扩展的幅度。如果相邻的文字开始互相粘连,就调小该值。这是用于处理间距很小的标记的控制项,例如紧挨着批号的日期代码。
这两个参数都是基于实时视频或已采集的图像进行调整的,这一点比听起来更重要。您不是凭空猜一个数值,然后等下一批生产才看到效果。您调整参数的同时就能看到检测框实时变化。
把读取结果转化为判定结论
读取文本只是检测工作的一半。另一半是判断读取到的内容是否正确,而这完全取决于该工位的检测目的。
- Presence. 到底有没有标记?这是最便宜也最常见的检测,能够发现跳过打标工位的空白零件。
- 与固定值进行匹配。 检测到的文本是否包含预期字符串?确保正确的标签贴在正确的产品上。
- 与实时值进行匹配。 读取结果是否与PLC所报的正在运行的零件编号一致?这项检测能够发现换型错误,它要求预期值来自产线本身,而不是手动录入配方参数。
- 格式校验。 日期代码是否是一个合理的日期,序列号的长度和字符集是否正确?能够发现虽然仍能读出内容、但实际上是不完整或模糊印刷的情况。
第三项检测正是字符识别从表面检查升级为可追溯性控制的关键所在。它还要求相机与PLC进行双向通信,既要接收预期值,又要返回读取结果。在OV80i上,这种交换通过EtherNet/IP或PROFINET实现,中间无需网关PC,这一点在报价阶段值得注意,因为独立的工业PC往往是字符识别方案中成本最高的单项。
适用场景与不适用场景
有一点需要明确其局限性。AI OCR的功能是读取文本,它不是通用的标记检测工具,也不会像印刷质量标准那样评估印刷质量。如果您的需求是评级条形码,或对印刷代码的反差和边缘确定性进行打分,那需要使用另一种设备。
它真正擅长的是几乎每条产线都存在、却因传统方案过于脆弱而很少实现自动化的日常可追溯性工作:序列号核验、日期和批号确认、标签与当前生产订单的核对,以及铸造或刻蚀零件的识别,这些工作以前都靠操作人员拿着手电筒检查。
关于应用范围的一点实用说明:字符识别通常与其他检测项共用同一个工位,而不是独占一个工位。读取零件编号的同一次拍摄,还可以确认连接器是否装配到位、卡扣是否存在,因为一套 AI视觉系统 可以在一张图像上运行多个检测模型。读取标记往往是您在原本就要搭建的工位上追加的最便宜的功能。
Frequently Asked Questions
AI OCR真的不需要训练数据吗?
对于字符识别来说,是的。该模型是基于通用文本预训练的,而字母和数字在您的产线上与其他任何地方形状都相同,因此无需您零件的图像即可直接迁移使用。您仍然需要设置文本出现的区域、调整检测参数,并确保光照和分辨率合适。您省去的是采集样品零件和标注字符,而这通常是视觉项目中耗时最长的部分。
机器视觉中的AI OCR与传统OCR有什么区别?
传统机器视觉OCR将候选区域与特定字体、特定尺寸的已训练字符模板库进行匹配。它速度快、结果确定,但缺乏灵活性:新字体、磨损的模具或旋转的零件都需要重新训练,否则就会产生误读。AI OCR则是根据学习到的通用特征来识别字符,因此能够容忍字体变化、笔画磨损和适度旋转。对于固定字体的清晰印刷文本,模板OCR依然表现出色,通常也更经济。AI OCR的价值则体现在铸造、刻蚀、打点或低反差的标记上。
机器视觉能否读取铸造或刻蚀在金属上的字符?
可以,但结果由光照而非模型决定。铸造和刻蚀的字符与周围表面颜色、材质相同,因此没有颜色反差可供读取,能利用的只有形貌起伏。漫射光会将这类标记完全冲淡。掠射表面的定向光或暗场布光会把每个字符的边缘变成阴影,从而产生模型所需的反差。请让最小字符的高度至少达到二十个像素。
OCR检测需要多高的分辨率?
一个实用的参考数值是,您必须读取的最小字符高度至少要达到二十个像素。低于这个数值,笔画细节就会丢失,相似的字形,比如8和6,或5和S,就很难可靠地区分开来。请从字符高度反推所需视场,再进一步推算传感器分辨率和镜头焦距,并结合您可用的工作距离。
相机能否将零件编号与PLC所报的运行型号进行核对?
可以,这项检测能够发现换型错误,而不仅仅是标记错误。它要求预期值来自产线本身,读取值也要返回给产线,这意味着需要通过EtherNet/IP或PROFINET与控制器进行双向数据交换。如果这一交换在相机上直接完成,就无需单独的网关PC,从而省去了字符识别方案中往往是最大一项的硬件成本。
OCR能否评估印刷质量或读取条形码?
OCR的功能是读取文本并确认其内容。它不是印刷质量评级仪器,也不会依照印刷代码标准对反差或边缘确定性进行打分。条形码和数据矩阵码的解码是另一项独立功能。如果您的需求是按照标准进行正式的印刷质量验证,那需要使用另一种设备,并应作为单独的需求明确提出。
在您的零件上体验 Overview AI
把您的零件或缺陷照片发给我们,视觉工程师会告诉您 Overview 能否检出,大多数系统几天内即可在产线上运行。