PDFMove
كيف تُطبَّق OCR على PDF الممسوح ضوئيًا؟ دليل خطوة بخطوة
كيفية العمل

كيف تُطبَّق OCR على PDF الممسوح ضوئيًا؟ دليل خطوة بخطوة

5 دقيقة للقراءة

لديك ملف PDF مرّ عبر ماسح ضوئي أو كاميرا هاتف، وتحاول نسخ النص بداخله لكن لا شيء قابل للتحديد. عندما تبحث بـ Ctrl+F، النتيجة صفر. هذه واحدة من أكثر مشكلات PDF شيوعًا لأن المستند الممسوح ضوئيًا هو في الواقع صورة وليس نصًا. حتى لو كان كل حرف في الصفحة مقروءًا بعينك، فهو بالنسبة للحاسوب مجرد بكسلات.

OCR (Optical Character Recognition — التعرف الضوئي على الحروف) هي العملية التي "تُحيي" المستند بإضافة طبقة نصية غير مرئية لكن قابلة للتحديد فوق هذه الصور. في هذا الدليل، أشرح خطوة بخطوة كيفية جعل PDF ممسوح ضوئيًا قابلًا للبحث والنسخ، وما يجب الانتباه إليه في النصوص التركية، وأكثر الأخطاء شيوعًا.

ماذا تضيف OCR إلى PDF الممسوح ضوئيًا؟

لنوضح أولًا ما الذي ستحصل عليه، لأن معرفة ما تفعله OCR وما لا تفعله يضبط توقعاتك بشكل صحيح:

  • إمكانية البحث: يمكنك البحث عن كلمة داخل المستند بـ Ctrl+F.
  • النسخ واللصق: يمكنك تحديد النص ونقله إلى ملف آخر.
  • توافق قارئ الشاشة: تزداد إمكانية الوصول لمستخدمي ضعاف البصر.
  • يبقى حجم الملف تقريبًا كما هو دائمًا: ما يُضاف هو فقط طبقة نصية غير مرئية، بينما تبقى الصورة كما هي.

لا تغيّر OCR مظهر المستند. تظل الصفحة تبدو كمسح ضوئي؛ يُوضَع فقط بيانات نصية خلفها. أي لا تتوقع "PDF نظيفًا مُعاد كتابته" — سترى بصريًا نفس المسح الأصلي تمامًا، والفرق الوحيد الذي ستشعر به هو قدرتك على تحديد النص.

خطوة بخطوة: إضافة طبقة نصية إلى PDF الممسوح ضوئيًا

الخطوة 1: جهّز ملفك

قبل البدء بـ OCR، راجع جودة المسح الخاص بك. إذا كان الملف الذي بحوزتك بدقة منخفضة جدًا (مثلًا أقل من 100 نقطة بالبوصة) أو ممسوحًا بشكل مائل/ضبابي، فسيخرج النص الناتج بنفس القدر من الخطأ. إن أمكن:

  • امسح الصفحات بشكل مستقيم ودون ظلال.
  • امسح بدقة تتراوح بين 200-300 نقطة بالبوصة (هذا هو النطاق الافتراضي لمعظم ماسحات المكاتب أصلًا).
  • إذا التقطت صورة بالهاتف، تأكد من ظهور جوانب المستند الأربعة بوضوح.

الخطوة 2: ارفع الملف إلى أداة OCR

اسحب ملف PDF الخاص بك وأفلته، أو ارفعه عبر منتقي الملفات. تتم عملية الرفع بالكامل داخل المتصفح؛ يبقى ملفك على جهازك دون إرساله إلى خادم أثناء المعالجة. هذا تفصيل مهم خاصة بالنسبة للمستندات الحساسة مثل العقود والفواتير وبطاقات الهوية.

الخطوة 3: تحقق من اختيار اللغة

يجب أن يعرف محرك OCR في أي لغة سيبحث عن الأحرف. إذا كان مستندك باللغة التركية، تأكد من ضبط خيار اللغة على التركية. إذا تخطيت هذه الخطوة، فقد تُتعرَّف الأحرف الخاصة باللغة التركية مثل "ı" و"ğ" و"ş" و"ö" و"ü" و"ç" بشكل خاطئ أو لا تُتعرَّف إطلاقًا — فمثلًا قد تظهر كلمة "çalışma" كـ"calisma" أو كسلسلة أحرف بلا معنى. إذا كان مستندك يحتوي على أكثر من لغة (مثل تقرير مختلط تركي-إنجليزي)، فإن تحديد ذلك يُحسّن النتيجة بشكل ملحوظ.

الخطوة 4: ابدأ العملية وانتظر

بناءً على عدد الصفحات وجودة المسح، قد تستغرق العملية من بضع ثوانٍ إلى بضع دقائق. تحلَّ بالصبر في الملفات الكبيرة كثيرة الصفحات؛ إذ تُحلَّل كل صفحة على حدة وتُوضَع طبقة النص الخاصة بتلك الصفحة تحديدًا.

الخطوة 5: نزّل النتيجة واختبرها

عند انتهاء العملية، نزّل ملفك وأجرِ تحققًا فوريًا: ابحث في عارض PDF بـ Ctrl+F عن كلمة تعرف أنها موجودة في المستند. إذا وُجدت، فهذا يعني نجاح OCR. بعد ذلك، جرّب تحديد بضع جمل ونسخها، وتحقق من صحة خروج النص.

نصائح عملية للحصول على نتيجة صحيحة

  • تسبب الصفحات الممسوحة بشكل مائل مشاكل. إذا بقي المستند مائلًا ببضع درجات أثناء المسح، يواجه محرك OCR صعوبة في متابعة السطور. إن أمكن، صحّح المسح وأعد المحاولة.
  • المستندات منخفضة التباين تمثل تحديًا. تُنتج المستندات القديمة المكتوبة بحبر باهت أو النسخ المصوَّرة الرمادية أخطاء تعرف أكثر مقارنة بالمسوحات الواضحة بالأبيض والأسود.
  • خط اليد على حدود قدرات OCR. صُممت تقنية OCR أساسًا للنص المطبوع؛ قد يصعب عليك الحصول على نتيجة متسقة في خط اليد.
  • انتبه لاختيار اللغة في المستندات متعددة اللغات. إذا كان عقد تركي يحتوي على عناوين بنود باللغة الإنجليزية، فإن اختيار التركية فقط قد يؤدي إلى تعرف خاطئ على تلك الأجزاء.
  • قد يختل ترتيب النص في الجداول والصفحات متعددة الأعمدة. تحاول OCR تفسير تخطيط الصفحة، لكن في الأعمدة المعقدة من نوع الجرائد، قد يخرج ترتيب الكلمات مختلفًا عما تتوقع؛ في هذه الحالة قد تحتاج لتحرير النص الذي نسخته يدويًا.

الأخطاء الشائعة

الخطأ 1: ترك اختيار اللغة على الافتراضي. هذه أكثر المشكلات شيوعًا. بدء العملية دون التحقق من إعداد اللغة في مستند تركي يؤدي إلى نتائج خاطئة خاصة في الأحرف الخاصة باللغة التركية.

الخطأ 2: تطبيق OCR مجددًا على PDF قابل للبحث بالفعل. رغم أن بعض ملفات PDF تبدو ممسوحة ضوئيًا في الظاهر، إلا أنها تحتوي بالفعل على طبقة نصية. إخضاعها لـ OCR دون التحقق أولًا بـ Ctrl+F خطوة غير ضرورية — لا تسبب ضررًا لكنها تُضيّع الوقت.

الخطأ 3: معالجة مسح رديء الجودة دون تحسينه. توقع نتيجة مثالية من صفحة ممسوحة بخط ضبابي أو صغير جدًا غير واقعي. تحسين المصدر يؤثر بشكل مباشر على نتيجة OCR.

الخطأ 4: البدء في الاستخدام دون التحقق من النتيجة. نتائج OCR ليست خالية من الأخطاء مئة بالمئة؛ قد تكون هناك أخطاء طفيفة خاصة في الأسماء الخاصة والأرقام والكلمات الأجنبية. إذا كنت ستستخدم المستند في إجراء رسمي (مثل الأرشفة أو المرجعية القانونية)، راجع على الأقل الأقسام الحرجة.

متى تحتاج إلى OCR، ومتى لا تحتاج؟

إذا كان ملف PDF الخاص بك قد أُنشئ مباشرة من معالج نصوص (Word، مستندات Google، إلخ) عبر "حفظ كـ PDF"، فمن المرجح جدًا أنه يحتوي بالفعل على طبقة نصية ولا يحتاج إلى OCR. الحالات التي تحتاج فيها فعليًا إلى OCR هي:

  • المستندات الورقية التي مُرت عبر ماسح ضوئي لسطح المكتب
  • الصفحات التي التُقطت صورتها بكاميرا الهاتف وحُوّلت إلى PDF
  • النسخ المُرقمنة من مستندات الأرشيف القديمة
  • الملفات التي وصلت عبر الفاكس وحُوّلت إلى PDF

السمة المشتركة لهذه المستندات هي أن المحتوى مُضمَّن في PDF كملف صورة. يمكنك توفير الوقت بإجراء اختبار سريع بـ Ctrl+F قبل تطبيق OCR.

الخلاصة

جعل PDF ممسوح ضوئيًا قابلًا للبحث عملية أبسط مما تبدو: اختيار إعداد اللغة الصحيح وتوفير مصدر بجودة معقولة يحددان الجزء الأكبر من النتيجة. بعد إتمام العملية، اجعل من عادتك إجراء اختبار بحث للتحقق من صحة التعرف على النص. بهذه الطريقة يمكنك العثور بسهولة على المستندات في أرشيفك، وكذلك نقل محتواها إلى مستندات أخرى.

الأسئلة الشائعة

هل يتغيّر مظهر PDF بعد تطبيق OCR؟

لا. لا تغيّر OCR الحالة المرئية للصفحة؛ تبقى الصورة الممسوحة ضوئيًا كما هي. تضيف العملية فقط طبقة نصية غير مرئية خلف الصورة، وبذلك يمكنك البحث عن النص ونسخه.

هل تسبب الأحرف غير اللاتينية (ı، ğ، ş، ö، ü، ç) مشكلة أثناء OCR؟

نعم، قد تسبب مشكلة إذا لم يُضبط اختيار اللغة على التركية. عند اختيار اللغة الصحيحة، تُتعرَّف هذه الأحرف بشكل صحيح في الغالبية العظمى من الحالات؛ ومع ذلك، بما أنه قد تظهر أخطاء طفيفة في المسوحات منخفضة الجودة، فإن التحقق من النتيجة مفيد.

هل يمكنني جعل نموذج مملوء بخط اليد قابلًا للبحث باستخدام OCR؟

تقنية OCR مُحسَّنة أساسًا للنصوص المطبوعة. في خط اليد، خاصة غير المنتظم أو المتصل، تنخفض دقة التعرف بشكل ملحوظ وقد يصعب عليك الحصول على نتيجة متسقة.

جرّب ذلك الآن باستخدام OCR (Taranmış PDF).

جرّب OCR (Taranmış PDF)