OCR thị giác máy: đọc dấu trên chi tiết mà không cần dữ liệu huấn luyện

OV80i inspection screen with OCR detection regions drawn around every line of text on a printed compliance label

Đọc ký tự là nhiệm vụ kiểm tra duy nhất mà cách tiếp cận AI giảm bớt công việc thay vì làm tăng thêm. Mọi loại kiểm tra AI khác đều bắt đầu bằng việc thu thập và gán nhãn hình ảnh các chi tiết của bạn. OCR thì không. Mô hình đã biết sẵn chữ cái và chữ số trông như thế nào, vì chữ cái và chữ số trên dây chuyền của bạn cũng giống hệt như ở bất kỳ nơi nào khác.

Chỉ riêng thực tế đó đã thay đổi kế hoạch dự án nhiều hơn là thay đổi công nghệ. Đây là ý nghĩa của nó trong thực tế, và những gì nó không giải quyết được.

Vì sao OCR không cần hình ảnh huấn luyện

Một mô hình phân loại hay phân đoạn phải được huấn luyện riêng cho các chi tiết cụ thể của bạn, vì một vết xước trên chi tiết đúc của bạn trông chẳng giống vết xước trên chi tiết ép đùn của người khác. Mô hình không có khái niệm sẵn có về bất kỳ trường hợp nào trong hai trường hợp đó.

Văn bản thì khác. Hình dạng ký tự được dùng chung trên mọi ngành công nghiệp, nên một mô hình chỉ cần huấn luyện một lần trên một khối lượng văn bản khổng lồ có thể áp dụng trực tiếp. Trên OV80i, khối OCR được chính sản phẩm mô tả là nhận dạng "văn bản in, số sê-ri và các văn bản chữ số khác mà không cần bất kỳ dữ liệu huấn luyện nào". Bạn chỉ cần vẽ một vùng nơi văn bản xuất hiện, và nó sẽ đọc nội dung bên trong.

Hệ quả thực tế là OCR bỏ qua hai bước thường chiếm phần lớn thời gian trong một dự án thị giác thông thường. Không cần chiến dịch thu thập hình ảnh, cũng không cần gán nhãn. Một tác vụ đọc lẽ ra phải mất hai tuần thu thập mẫu nay chỉ còn là một vùng được vẽ trong một buổi chiều.

Những gì bạn bỏ qua

Thu thập chi tiết đại diện, gán nhãn ký tự, chờ đủ số lượng mẫu lỗi, huấn luyện lại khi xuất hiện số hiệu chi tiết mới. Không điều nào trong số đó áp dụng ở đây. Một số hiệu chi tiết mà dây chuyền chưa từng sản xuất vẫn được đọc chính xác.

Những gì bạn vẫn phải làm

Chọn đúng quang học và ánh sáng, thiết lập vùng đọc, tinh chỉnh hai thông số phát hiện, và quyết định quy tắc đạt sẽ so sánh với gì. Công việc đó không hề biến mất, và đây chính là nơi quyết định một dự án OCR thành công hay thất bại.

Nó khác OCR truyền thống ở điểm nào

Việc đọc ký tự trong thị giác máy truyền thống hoạt động theo cách khớp mẫu. Bạn huấn luyện hệ thống theo hình dạng của từng ký tự với phông chữ và kích thước cụ thể của mình, rồi hệ thống so sánh các vùng ứng viên với thư viện đó. Cách này nhanh, cho kết quả xác định, nhưng hoàn toàn cứng nhắc.

Sự cứng nhắc không sao cả cho đến khi có gì đó thay đổi. Một nhà cung cấp mới dập một phông chữ hơi khác. Khuôn dập mòn khiến nét ký tự mảnh đi. Một chi tiết đến nơi bị xoay lệch vài độ. Mỗi trường hợp đó đều đòi hỏi phải huấn luyện lại thư viện mẫu, hoặc sẽ gây ra lỗi đọc, và lỗi đọc trong một kiểm tra truy xuất nguồn gốc rất tốn kém vì chi tiết đó giờ bị ghi nhận thành một thứ khác với thực tế.

SituationTemplate OCRAI OCR
Phông chữ hoặc nhà cung cấp mớiCần huấn luyện lại thư viện ký tựĐọc được ngay, không cần thay đổi
Nét chữ mòn hoặc mảnh điĐộ tin cậy giảm, xuất hiện lỗi đọcSuy giảm dần dần, chịu đựng tốt hơn
Chi tiết bị xoay trong đồ gáCần căn chỉnh trướcXử lý được độ xoay vừa phải
Dấu đúc, khắc hoặc dập chấmKhó khăn, độ tương phản thấp khiến mẫu khớp thất bạiKhả thi nếu có ánh sáng phù hợp
Phông chữ cố định, in rõ nét, sản lượng lớnRất tốt, và rẻ hơnCũng tốt, không có lợi thế gì thêm

Hàng cuối cùng rất quan trọng. Nếu bạn đang đọc các ký tự phun mực sắc nét với phông chữ cố định trên nhãn phẳng, OCR truyền thống đã giải quyết tốt việc này suốt ba mươi năm qua và không có lý do gì để thay đổi. OCR AI chứng minh giá trị của mình ở những dấu khó: ký tự đúc trong kim loại, khắc bằng laser trên bề mặt phản chiếu gương, dập chấm, hoặc in trên nền cong hay có kết cấu.

Low contrast cast-in characters on a machined axle component with the recognised character highlighted in the AI overlay
Nhận dạng chi tiết đúc trên một bộ phận trục. Các ký tự có cùng màu với chi tiết, nằm trên bề mặt phản chiếu gương thô ráp, và không hề có mực. Đây chính là trường hợp khiến phương pháp khớp mẫu gặp khó khăn.

Ánh sáng vẫn là yếu tố quyết định kết quả

Loại bỏ yêu cầu về dữ liệu huấn luyện không có nghĩa là loại bỏ được các quy luật vật lý. Mô hình chỉ có thể đọc được độ tương phản có thực trong hình ảnh, và trên một dấu dập nổi hay khắc chìm thì không có sự khác biệt màu sắc nào để khai thác. Ký tự và bề mặt là cùng một loại vật liệu. Thứ duy nhất bạn có là địa hình bề mặt.

Điều đó khiến hình học chiếu sáng trở thành yếu tố quyết định toàn bộ. Ánh sáng tán xạ sẽ xóa nhòa hoàn toàn một dấu khắc, vì nó chiếu sáng phần lõm của ký tự đều như bề mặt xung quanh. Một bố trí ánh sáng định hướng hoặc trường tối lướt qua bề mặt và biến mỗi cạnh ký tự thành một vùng bóng đổ, đó chính là độ tương phản mà mô hình có thể sử dụng. Hướng dẫn của chúng tôi về chiếu sáng trong thị giác máy trình bày sáu hình học chiếu sáng và cách chọn một loại dựa trên đặc điểm bạn cần quan sát.

Độ phân giải là ràng buộc thứ hai. Một nguyên tắc thực tế hiệu quả là nhắm tới ít nhất hai mươi pixel trên chiều cao của ký tự nhỏ nhất. Dưới mức đó, chi tiết nét chữ bắt đầu mất đi và việc phân biệt các ký tự giống nhau, chẳng hạn số 8 với số 6 hay số 5 với chữ S, trở nên khó khăn. Các công cụ tính toán quang học chuyển đổi chiều cao ký tự và khoảng cách làm việc thành trường nhìn và ống kính phù hợp để đạt được điều đó.

Tinh chỉnh, và hai thông số quan trọng

Một vùng OCR trên OV80i trình bày các thông số phát hiện bằng ngôn ngữ đơn giản, thay vì các ngưỡng mà bạn phải tự suy luận ngược. Hai trong số đó đảm nhận phần lớn công việc.

Diện tích văn bản tối thiểu

Lọc các vùng ứng viên theo kích thước. Sản phẩm mô tả trực tiếp: tăng giá trị này nếu nhiễu bị nhận diện thành văn bản, giảm giá trị này nếu văn bản nhỏ bị lọc mất. Đây là thông số điều khiển dùng cho bề mặt có đốm nhiễu, kết cấu đúc, hoặc vết gia công bị đọc nhầm thành các ký tự nhỏ li ti.

Tỷ lệ mở rộng

Kiểm soát mức độ mở rộng ra ngoài của mỗi vùng văn bản được phát hiện. Giảm giá trị này nếu các từ gần nhau bắt đầu dính vào nhau. Đây là thông số điều khiển dùng cho các dấu nằm sát nhau, chẳng hạn mã ngày nằm ngay cạnh số lô.

Cả hai thông số này đều được tinh chỉnh dựa trên video trực tiếp hoặc hình ảnh đã chụp, điều này quan trọng hơn nó nghe có vẻ. Bạn không phải đoán mò một con số rồi chờ đến lượt sản xuất tiếp theo mới thấy hiệu quả. Bạn thay đổi thông số và quan sát các khung phát hiện di chuyển ngay lập tức.

Biến một lần đọc thành một phán quyết

Đọc được văn bản chỉ mới là một nửa của công việc kiểm tra. Nửa còn lại là xác định liệu nội dung đọc được có đúng hay không, và điều đó hoàn toàn phụ thuộc vào mục đích của trạm kiểm tra đó.

  1. Presence. Có dấu hay không? Đây là kiểm tra rẻ nhất và phổ biến nhất, giúp phát hiện chi tiết trống do bị bỏ qua trạm đóng dấu.
  2. So khớp với một giá trị cố định. Văn bản được phát hiện có chứa chuỗi mong đợi hay không? Đảm bảo đúng nhãn trên đúng sản phẩm.
  3. So khớp với một giá trị thời gian thực. Kết quả đọc có khớp với số hiệu chi tiết mà PLC báo đang chạy hay không? Đây là kiểm tra giúp phát hiện lỗi chuyển đổi sản phẩm, và nó cần giá trị mong đợi được gửi đến từ dây chuyền, thay vì được nhập tay vào một công thức sản xuất.
  4. Xác thực định dạng. Mã ngày có phải là một ngày hợp lý không, số sê-ri có đúng độ dài và bộ ký tự không? Phát hiện bản in bị thiếu hoặc nhòe nhưng vẫn đọc ra được thành một nội dung nào đó.

Kiểm tra thứ ba chính là lúc việc đọc ký tự không còn chỉ là một kiểm tra bề ngoài mà trở thành một biện pháp kiểm soát truy xuất nguồn gốc. Nó cũng đòi hỏi camera phải giao tiếp hai chiều với PLC, nhận giá trị mong đợi và trả về kết quả đọc. Trên OV80i, việc trao đổi đó diễn ra qua EtherNet/IP hoặc PROFINET mà không cần PC cổng kết nối trung gian, điều này đáng lưu ý ở giai đoạn báo giá vì một PC công nghiệp riêng thường là hạng mục chi phí lớn nhất trong một đề xuất đọc ký tự.

Nơi nó phù hợp, và nơi nó không phù hợp

Cần làm rõ một giới hạn. OCR AI đọc văn bản. Đây không phải là công cụ kiểm tra dấu đa năng, và nó sẽ không đánh giá chất lượng in theo cách một tiêu chuẩn chất lượng in làm. Nếu yêu cầu của bạn là chấm điểm mã vạch hoặc đánh giá độ tương phản và độ xác định cạnh của một mã in, đó là một thiết bị khác.

Điều nó thực sự giỏi là công việc truy xuất nguồn gốc hàng ngày, vốn tồn tại ở gần như mọi dây chuyền nhưng hiếm khi được tự động hóa vì phiên bản truyền thống quá thiếu ổn định để đáng đầu tư. Đó là xác minh số sê-ri, xác nhận mã ngày và mã lô, kiểm tra nhãn theo đúng lệnh sản xuất đang chạy, và nhận dạng chi tiết đúc hoặc khắc trên các bộ phận mà trước đây phải do người vận hành dùng đèn pin kiểm tra.

Một lưu ý thực tế về phạm vi: việc đọc ký tự thường dùng chung một trạm với các kiểm tra khác chứ không chiếm riêng một trạm. Cùng một lần chụp đọc số hiệu chi tiết cũng có thể xác nhận đầu nối đã được lắp đúng vị trí và có kẹp hiện diện, vì một hệ thống thị giác AI có thể chạy nhiều mô hình kiểm tra trên cùng một hình ảnh. Đọc dấu thường là hạng mục rẻ nhất mà bạn bổ sung vào một trạm mà dù sao bạn cũng đang xây dựng.

Frequently Asked Questions

OCR AI có thực sự không cần dữ liệu huấn luyện không?

Đối với việc đọc ký tự, đúng vậy. Mô hình được huấn luyện trước trên văn bản nói chung, và chữ cái, chữ số trên dây chuyền của bạn có hình dạng giống hệt như ở bất kỳ nơi nào khác, nên nó có thể áp dụng trực tiếp mà không cần hình ảnh các chi tiết của bạn. Bạn vẫn phải thiết lập vùng nơi văn bản xuất hiện, tinh chỉnh các thông số phát hiện, và đảm bảo ánh sáng cùng độ phân giải phù hợp. Điều bạn bỏ qua là việc thu thập chi tiết mẫu và gán nhãn ký tự, vốn thường là phần tốn thời gian nhất của một dự án thị giác.

Sự khác biệt giữa OCR AI và OCR truyền thống trong thị giác máy là gì?

OCR thị giác máy truyền thống so khớp các vùng ứng viên với một thư viện mẫu ký tự đã được huấn luyện theo phông chữ và kích thước cụ thể. Nó nhanh và cho kết quả xác định nhưng cứng nhắc: một phông chữ mới, một khuôn dập mòn, hay một chi tiết bị xoay lệch đều đòi hỏi huấn luyện lại hoặc gây ra lỗi đọc. Trong khi đó, OCR AI nhận dạng ký tự dựa trên các đặc trưng tổng quát đã học được, nên nó chịu được thay đổi phông chữ, hao mòn nét chữ và độ xoay vừa phải. Đối với văn bản in sắc nét với phông chữ cố định, OCR dựa trên mẫu vẫn rất tốt và thường rẻ hơn. OCR AI chứng minh giá trị của mình trên các dấu đúc, khắc, dập chấm hoặc có độ tương phản thấp.

Thị giác máy có thể đọc các ký tự đúc hoặc khắc trên kim loại không?

Có thể, nhưng kết quả do ánh sáng quyết định chứ không phải do mô hình. Ký tự đúc và khắc có cùng màu sắc và vật liệu với bề mặt xung quanh, nên không có độ tương phản màu sắc để đọc, chỉ có địa hình bề mặt. Ánh sáng tán xạ sẽ xóa nhòa những dấu đó. Một bố trí ánh sáng định hướng hoặc trường tối lướt qua bề mặt sẽ biến mỗi cạnh ký tự thành một vùng bóng đổ, tạo ra độ tương phản mà mô hình cần. Hãy nhắm tới ít nhất hai mươi pixel trên chiều cao của ký tự nhỏ nhất.

Tôi cần độ phân giải bao nhiêu để kiểm tra OCR?

Một con số thực tế để tham khảo là tối thiểu hai mươi pixel trên chiều cao của ký tự nhỏ nhất mà bạn cần đọc. Dưới mức đó, chi tiết nét chữ sẽ mất đi và các ký tự giống nhau, chẳng hạn số 8 với số 6, hoặc số 5 với chữ S, sẽ trở nên khó phân biệt một cách đáng tin cậy. Hãy tính ngược từ chiều cao ký tự ra trường nhìn, rồi từ đó ra độ phân giải cảm biến và tiêu cự ống kính tương ứng với khoảng cách làm việc bạn có.

Camera có thể đối chiếu số hiệu chi tiết với thông tin PLC báo đang chạy không?

Có, và đây là kiểm tra giúp phát hiện lỗi chuyển đổi sản phẩm chứ không chỉ lỗi đóng dấu. Nó đòi hỏi giá trị mong đợi phải được gửi đến từ dây chuyền và giá trị đọc được phải được trả về, nghĩa là cần trao đổi dữ liệu hai chiều với bộ điều khiển qua EtherNet/IP hoặc PROFINET. Khi việc đó chạy ngay trên camera, không cần PC cổng kết nối riêng, giúp loại bỏ hạng mục phần cứng thường là lớn nhất trong một đề xuất đọc ký tự.

OCR có thể đánh giá chất lượng in hoặc đọc mã vạch không?

OCR đọc văn bản và xác nhận nội dung của nó. Đây không phải là thiết bị đánh giá chất lượng in và sẽ không chấm điểm độ tương phản hay độ xác định cạnh theo một tiêu chuẩn mã in. Giải mã mã vạch và mã ma trận dữ liệu là một chức năng riêng biệt. Nếu yêu cầu của bạn là xác minh chất lượng in chính thức theo một tiêu chuẩn, đó là một thiết bị khác và cần được nêu rõ như vậy.

Xem Overview AI trên linh kiện của bạn

Gửi cho chúng tôi ảnh chụp linh kiện hoặc lỗi của bạn, một kỹ sư thị giác sẽ cho bạn biết Overview có phát hiện được không, phần lớn hệ thống chạy trên dây chuyền trong vài ngày.

Bài viết liên quan