التعرف الضوئي على الحروف (OCR)، اختصار لـ التعرف البصري على الحروف، هي التقنية التي تقوم بتحويل النص الموجود داخل الصور والملفات الممسوحة ضوئيًا وملفات PDF المستندة إلى الصور إلى نص يمكن قراءته آليًا. من الناحية العملية، يقوم التعرف الضوئي على الحروف (OCR) بتحويل صورة إيصال أو عقد ممسوح ضوئيًا أو نموذج ورقي إلى محتوى رقمي يمكن البحث فيه ونسخه وفهرسته وتحليله ودمجه في سير عمل الأعمال.
بالنسبة للشركات، يعد التعرف الضوئي على الحروف (OCR) أكثر من مجرد ميزة مريحة. إنه جزء أساسي من التحول الرقمي لأنه يسد الفجوة بين المستندات الورقية والبيانات الرقمية المنظمة. بدون تقنية التعرف الضوئي على الحروف (OCR)، غالبًا ما تكون الملفات الممسوحة ضوئيًا مجرد صور. ومع تقنية التعرف الضوئي على الحروف (OCR)، فإنها تصبح أصولًا تجارية قابلة للاستخدام.
لماذا يهم التعرف الضوئي على الحروف
لا تزال العديد من الشركات تتلقى المعلومات في نماذج يصعب معالجتها تلقائيًا: الفواتير والإيصالات والعقود ومذكرات التسليم ومستندات الهوية والنماذج والسجلات الطبية والملفات الورقية المؤرشفة. عندما يتم مسح هذه الملفات ضوئيًا بدون التعرف الضوئي على الحروف، يكون النص مرئيًا للبشر ولكنه مخفي عن أنظمة البرامج. يحل OCR هذه المشكلة عن طريق استخراج النص وجعله قابلاً للبحث والمعالجة.
ولهذا السبب يتم استخدام التعرف الضوئي على الحروف (OCR) على نطاق واسع في الإنشاء ملفات PDF قابلة للبحث، وتحسين استرجاع المستندات، وتقليل إدخال البيانات يدويًا، ودعم أرشفة الامتثال، وتسريع الأتمتة النهائية. أدوبي تؤكد إرشادات PDF القابلة للبحث ونظرة عامة على OCR من AWS على أن OCR يحول المستندات المستندة إلى الصور إلى ملفات قابلة للتحرير أو البحث، مما يوفر الوقت ويحسن الكفاءة.
كيف يعمل التعرف الضوئي على الحروف
على مستوى عالٍ، عادةً ما يتبع التعرف الضوئي على الحروف سير عمل متعدد الخطوات.
1. الحصول على الصور
تبدأ العملية بإدخال صورة أو مستند، مثل ملف PDF ممسوح ضوئيًا أو صورة هاتف أو TIFF أو PNG أو JPEG. يتلقى النظام أولاً المحتوى المرئي ويقوم بإعداده للتحليل. تصف شركة IBM هذه المرحلة الأولية بأنها تحويل المصدر إلى نموذج مناسب للتعرف عليه.
2. المعالجة المسبقة
قبل التعرف، غالبًا ما تقوم محركات التعرف الضوئي على الحروف (OCR) بتنظيف الصورة وتطبيعها. يمكن أن يشمل ذلك إزالة التشويش وزيادة التباين وتنعيم الحواف وتصحيح الانحراف ومعالجة المحاذاة الضعيفة. يشير Google Cloud بوضوح إلى تصحيح الانحناء والتدوير كميزات تعمل على تحسين جودة الاستخراج، بينما تسلط شركة IBM الضوء على المعالجة المسبقة باعتبارها مرحلة مهمة لإزالة وحدات البكسل الدخيلة وتصحيح محاذاة الصفحة.
3. الكشف عن النص
يقوم نظام التعرف الضوئي على الحروف بعد ذلك بتحديد مكان ظهور النص على الصفحة. تصف شركة IBM تقنية التعرف الضوئي على الحروف (OCR) بأنها تتضمن أ كشف المرحلة التي تقوم بترجمة الكلمات في المستند. يمكن لمنصات التعرف الضوئي على الحروف (OCR) الحديثة اكتشاف الكتل والفقرات والسطور والكلمات وأحيانًا الرموز.
4. التعرف على النص
بمجرد العثور على مناطق النص، يتعرف النظام على الأحرف أو الكلمات. يعتمد التعرف الضوئي على الحروف التقليدي بشكل كبير على مطابقة الأنماط وقوالب الخطوط. تستخدم الأنظمة الأكثر حداثة التعلم الآلي والشبكات العصبية للتعرف على النص المطبوع والكتابة اليدوية واللغات المختلطة والتخطيطات المعقدة بشكل أكثر دقة. تلاحظ Microsoft أن تقنية التعرف الضوئي على الحروف (OCR) الحديثة تستخرج النص المطبوع والمكتوب بخط اليد ويمكنها إخراج الكلمات والسطور وكتل النص، بينما تسلط وثائق Tesseract الضوء على محرك التعرف الضوئي على الحروف (OCR) القائم على LSTM.
5. الهيكلة والتصدير
قد يكون الإخراج النهائي عبارة عن نص عادي أو PDF أو DOCX أو XML أو JSON قابل للبحث أو بيانات منظمة جاهزة لقاعدة البيانات. في السيناريوهات الأكثر تقدمًا، لا يقتصر إخراج OCR على النص وحده. ويمكن أن تتضمن الإحداثيات ودرجات الثقة وبنية الصفحة والتسلسل الهرمي للتخطيط وعناصر المستند التي تم اكتشافها مثل مربعات الاختيار أو حقول النموذج أو محتوى الجدول.
أنواع التعرف الضوئي على الحروف
أحد أسباب تصنيف مقالات التعرف الضوئي على الحروف بشكل جيد هو أنها لا تتوقف عند التعريف الأساسي. غالبًا ما يشرحون أن التعرف الضوئي على الحروف يقع ضمن عائلة أوسع من تقنيات التعرف.
التعرف الضوئي على الحروف البسيط
يقوم التعرف الضوئي على الحروف البسيط بشكل عام بمطابقة أنماط الصور مع الخطوط المخزنة أو قوالب الأحرف. يعمل بشكل أفضل مع المستندات الواضحة والمطبوعة ذات الخطوط المتوقعة والتخطيطات الواضحة. تسرد AWS هذا كفئة أساسية للتعرف الضوئي على الحروف استنادًا إلى خوارزميات المطابقة.
ICR (التعرف الذكي على الأحرف)
يعد ICR امتدادًا لـ OCR الذي يستخدم التعلم الآلي لتفسير الأحرف المطبوعة يدويًا والمزيد من أشكال الأحرف المتغيرة. إنه ذو أهمية خاصة عند التعامل مع النماذج المكتوبة بخط اليد أو المدخلات ذات التنسيق المختلط. يميز كل من AWS وABBYY بين ICR والتعرف الضوئي على الحروف (OCR) القياسي.
IWR (التعرف الذكي على الكلمات)
يعمل IWR على مستوى الكلمة وليس على مستوى الحرف بشكل صارم. يمكن أن يؤدي ذلك إلى تحسين الأداء في بعض سيناريوهات الكتابة اليدوية أو التقاط المستندات حيث يساعد السياق في تحديد الكلمات الكاملة بشكل أكثر موثوقية. تتضمن AWS التعرف الذكي على الكلمات كنوع منفصل مرتبط بالتعرف الضوئي على الحروف.
OMR (التعرف البصري على العلامات)
غالبًا ما تتم مناقشة OMR جنبًا إلى جنب مع التعرف الضوئي على الحروف (OCR)، على الرغم من اختلافه من الناحية الفنية. بدلاً من قراءة الحروف، يحدد OMR علامات مثل الفقاعات المملوءة وخانات الاختيار ومناطق التحديد. في سير عمل المستندات العملية، غالبًا ما يتم الجمع بين التعرف الضوئي على الحروف (OCR) و OMR في الاختبارات والاستطلاعات ونماذج الطلبات وقوائم المراجعة.
التعرف على النص الكامل مقابل التعرف على مستوى الحقل
يقوم ABBYY أيضًا بالتمييز المفيد بين التعرف على النص الكامل و الاعتراف على المستوى الميداني. يتم استخدام التعرف على النص الكامل لتحويل المستندات وأرشفتها وإعادة استخدام المحتوى، بينما يركز التعرف على مستوى الحقل على استخراج قيم محددة من مناطق معينة، مثل إجماليات الفواتير أو التواريخ أو الأسماء أو أرقام المعرفات.
التعرف الضوئي على الحروف مقابل الذكاء الاصطناعي التعرف الضوئي على الحروف
يركز التعرف الضوئي على الحروف (OCR) التقليدي بشكل أساسي على تحويل النص المرئي إلى نص يمكن قراءته بواسطة الآلة. يذهب AI OCR إلى أبعد من ذلك. يمكنه فهم التخطيط وتحديد بنية المستند واكتشاف الجداول وتفسير النماذج واستخراج أزواج القيمة الرئيسية وقراءة الكتابة اليدوية واستنتاج العلاقات بين الحقول في بعض الأحيان.
وهذا هو السبب وراء قيام العديد من الأنظمة الأساسية السحابية الآن بوضع التعرف الضوئي على الحروف (OCR) كجزء من المعالجة الذكية للمستندات (IDP) أو وثيقة منظمة العفو الدولية بدلاً من أن تكون بمثابة أداة قائمة بذاتها. تنص Microsoft على أن التعرف الضوئي على الحروف (OCR) يعد أمرًا أساسيًا لـ IDP، بينما يضيف التعرف الضوئي على الحروف (OCR) الخاص بمستندات Google Cloud ميزات مثل تلميحات اللغة، وتصحيح التدوير، وتسجيل جودة الصورة، واستخراج مربع الاختيار، واكتشاف نمط الخط.
بمعنى آخر، يجيب التعرف الضوئي على الحروف الأساسي على السؤال: "ما النص الموجود في هذه الصفحة؟"
الذكاء الاصطناعي للتعرف الضوئي على الحروف (AI OCR) وذكاء المستندات يجيبان على السؤال الأكبر: "ماذا تحتوي هذه الوثيقة، وما هي البيانات المهمة؟"
حالات استخدام التعرف الضوئي على الحروف الشائعة
يتم استخدام التعرف الضوئي على الحروف (OCR) في العديد من الصناعات لأن النص المحاصر داخل الصور يمثل مشكلة عالمية.
PDF قابل للبحث والمحفوظات الرقمية
إحدى حالات الاستخدام الأكثر شيوعًا هي تحويل ملفات PDF الممسوحة ضوئيًا أو المرسلة بالفاكس إلى مستندات قابلة للبحث. يعد هذا أمرًا بالغ الأهمية بالنسبة للأرشيفات والملفات القانونية وسجلات الامتثال وتخزين المستندات التاريخية. توضح Adobe أن ملفات PDF المبنية على الصور تحتاج إلى تقنية التعرف الضوئي على الحروف (OCR) قبل أن يتمكن المستخدمون من البحث بداخلها.
معالجة الفواتير والإيصالات والنماذج
تستخدم فرق الحسابات الدائنة والتمويل والخدمات اللوجستية والعمليات تقنية التعرف الضوئي على الحروف (OCR) لاستخراج البيانات من الفواتير وأوامر الشراء والإيصالات ومستندات التسليم. يقلل التعرف الضوئي على الحروف (OCR) من المفاتيح اليدوية ويدعم التوجيه التلقائي إلى أنظمة تخطيط موارد المؤسسات (ERP) والمحاسبة وسير العمل. تقوم AWS بشكل متكرر بتسليط الضوء على الإيصالات والنماذج والفواتير والعقود باعتبارها سيناريوهات التعرف الضوئي على الحروف (OCR) وIDP الرئيسية.
وثائق الهوية والتأهيل
يمكن لـ OCR تسريع سير عمل إعداد العملاء والتحقق من خلال قراءة البيانات من المعرفات والتراخيص والتطبيقات والمستندات الداعمة. في هذه الحالات، عادةً ما يتم إقران التعرف الضوئي على الحروف (OCR) بمنطق التحقق من الصحة والمراجعة البشرية لاتخاذ القرارات ذات المخاطر العالية. ينعكس هذا الاتجاه الأوسع لمعالجة المستندات في التعرف الضوئي على الحروف (OCR) في Microsoft وGoogle Cloud وتحديد موضع ذكاء المستندات.
محتوى متعدد اللغات والكتابة اليدوية
تدعم منصات التعرف الضوئي على الحروف (OCR) الحديثة بشكل متزايد لغات متعددة، وفي بعض الحالات، مستندات متعددة اللغات. تدعم Microsoft الملاحظات النص المطبوع والمكتوب بخط اليد بلغات متعددة، كما تقوم Google باكتشاف لغة المستندات وتلميحات اللغة لتحسين النتائج.
استخراج نص الصورة العامة
بالإضافة إلى المستندات، يتم استخدام التعرف الضوئي على الحروف (OCR) أيضًا للملصقات واللافتات والملصقات والحزم ولقطات الشاشة وصور المنتجات. تقوم Microsoft على وجه التحديد بفصل التعرف الضوئي على الحروف (OCR) للصور العامة "الواقعية" عن التعرف الضوئي على الحروف (OCR) المحسّن للمستندات بالنسبة للمستندات الممسوحة ضوئيًا أو الرقمية.
أدوات مجانية: صورة مجانية إلى نص
ما يؤثر على دقة التعرف الضوئي على الحروف
لا يتم تحديد دقة التعرف الضوئي على الحروف بواسطة البرنامج وحده. جودة الصورة وظروف الوثيقة لها أهمية كبيرة.
تحدد شركة IBM عدة أسباب شائعة لصعوبة التعرف الضوئي على الحروف: الدقة غير الكافية، والإضاءة السيئة، وفقدان التركيز، والصفحات غير المحاذاة، وإعدادات الماسح الضوئي غير الصحيحة، والتشوهات الناتجة عن ضعف الطباعة. تضيف Google مشكلات التدوير والوهج والضبابية والخطوط الصغيرة إلى قائمة العوامل التي يمكن أن تؤثر على جودة الاستخراج.
لتحسين أداء التعرف الضوئي على الحروف، من الأفضل عمومًا القيام بما يلي:
- التقاط المستندات بدقة مناسبة،
- تجنب الضبابية والظلال ،
- الانحراف الصحيح والدوران،
- الحفاظ على التباين عاليًا،
- استخدم النسخ الأصلية النظيفة عندما يكون ذلك ممكنًا،
- تقديم تلميحات اللغة عندما تكون اللغة المصدر معروفة،
- وتطبيق التحقق البشري عند استخراج بيانات الأعمال الهامة.
بالنسبة لمحتوى تحسين محركات البحث (SEO)، يعد هذا القسم مهمًا لأن المستخدمين الذين يبحثون عن "التعرف الضوئي على الحروف" غالبًا ما يريدون أيضًا معرفة سبب كون نتائج التعرف الخاصة بهم غير دقيقة أو غير متسقة.
خيارات برامج التعرف الضوئي على الحروف: المصدر المفتوح مقابل التعرف الضوئي على الحروف السحابي
تنقسم أدوات التعرف الضوئي على الحروف عادةً إلى مجموعتين عريضتين: المحركات مفتوحة المصدر والخدمات السحابية المُدارة.
تسراكت يعد أحد أشهر محركات التعرف الضوئي على الحروف (OCR) مفتوحة المصدر. تنص وثائقه على أنه مفتوح المصدر بموجب ترخيص Apache 2.0، ويدعم مجموعة واسعة من اللغات، ويتضمن محركًا يستند إلى LSTM تم تقديمه في Tesseract 4. وهو خيار قوي للمطورين الذين يريدون التحكم والمعالجة دون الاتصال بالإنترنت وعدم تقييد البائع، على الرغم من أن النشر والتحسين يتطلب جهدًا فنيًا.
توفر منصات التعرف الضوئي على الحروف (OCR) السحابية المُدارة من موفري الخدمات مثل Google Cloud وMicrosoft وAWS بشكل عام إمكانية توسيع النطاق بشكل أسهل ومعالجة اللغة المضمنة واستخراج التخطيط ودرجات الثقة وميزات المستندات المنظمة. غالبًا ما تكون الخيار الأفضل عندما تحتاج الشركات إلى نشر أسرع ودعم مؤسسي وفهم متقدم للمستندات.
هل تقنية التعرف الضوئي على الحروف كافية بمفردها؟
بالنسبة للمهام البسيطة مثل تحويل ملف PDF ممسوح ضوئيًا إلى نص قابل للبحث، قد يكون التعرف الضوئي على الحروف (OCR) كافيًا. لكن العديد من الشركات تحتاج الآن إلى أكثر من مجرد استخراج النص. إنهم بحاجة إلى تصنيف المستندات، وتحليل الجدول، وفهم النموذج، واستخراج القيمة الرئيسية، والتحقق من الصحة، وتوجيه سير العمل، والتحليلات. ولهذا السبب يتم استخدام التعرف الضوئي على الحروف بشكل متزايد كأساس لأنظمة أتمتة المستندات الأكبر حجمًا وليس كخطوة قائمة بذاتها.
خاتمة
يعد التعرف الضوئي على الحروف (OCR) تقنية أساسية لتحويل المعلومات الورقية والمصورة إلى بيانات رقمية قابلة للاستخدام. في أبسط صوره، يقوم OCR بتحويل النص المرئي إلى نص يمكن قراءته بواسطة الآلة. على مستوى أكثر تقدمًا، يمكن لأنظمة التعرف الضوئي على الحروف (OCR) الحديثة التي تعمل بالذكاء الاصطناعي فهم التخطيط والكتابة اليدوية والجداول ومربعات الاختيار وبنية المستندات، مما يجعلها أساسية لمعالجة المستندات الذكية.
بالنسبة للمستخدمين والشركات على حد سواء، فإن القيمة الحقيقية للتعرف الضوئي على الحروف لا تتمثل في مجرد قراءة الكلمات من الصورة. إنها تجعل المستندات قابلة للبحث وقابلة للتنفيذ وجاهزة للأتمتة. ولهذا السبب لا يزال التعرف الضوئي على الحروف أحد أهم التقنيات في رقمنة المستندات وكفاءة سير العمل وإدارة معلومات المؤسسة.
التعليمات
ما الذي يرمز إليه التعرف الضوئي على الحروف (OCR)؟
يرمز التعرف الضوئي على الحروف (OCR) إلى التعرف البصري على الحروف. ويشير إلى التكنولوجيا التي تستخرج النص من الصور والمسح الضوئي وملفات PDF المستندة إلى الصور وتحول هذا النص إلى نموذج يمكن قراءته بواسطة الآلة.
هل يستطيع التعرف الضوئي على الحروف (OCR) قراءة الكتابة اليدوية؟
نعم، يمكن للعديد من أنظمة التعرف الضوئي على الحروف (OCR) الحديثة قراءة بعض النصوص المكتوبة بخط اليد أو المطبوعة يدويًا على الأقل. تميز Microsoft وAWS بين OCR القياسي والأساليب الأكثر تقدمًا مثل ICR للسيناريوهات المتعلقة بالكتابة اليدوية.
لماذا لا يمكن البحث في ملف PDF الممسوح ضوئيًا؟
لأنه يتم حفظ العديد من ملفات PDF الممسوحة ضوئيًا كصور، وليس كمستندات نصية. يجب تطبيق التعرف الضوئي على الحروف (OCR) قبل البحث عن النص أو نسخه أو فهرسته.
ما هو الفرق بين التعرف الضوئي على الحروف (OCR) و AI OCR؟
يركز OCR على قراءة النص. عادةً ما يضيف الذكاء الاصطناعي للتعرف الضوئي على الحروف (AI OCR) إمكانات فهم المستندات مثل تحليل التخطيط واستخراج الجدول ودعم الكتابة اليدوية والكشف الميداني.
ما هو الفرق بين التعرف الضوئي على الحروف (OCR) و OMR؟
يقرأ OCR الأحرف والكلمات، بينما يكتشف OMR علامات مثل الفقاعات المملوءة أو مربعات الاختيار أو التحديدات في النماذج.
هل لا تزال Tesseract ذات صلة؟
نعم. يظل Tesseract محركًا رئيسيًا مفتوح المصدر للتعرف الضوئي على الحروف، مع ترخيص Apache 2.0 ودعم واسع النطاق للغات والتعرف على LSTM.