استخراج النص من PDF إلى TXT: دليل عملي خطوة بخطوة
5 دقيقة للقراءة
لديك ملف PDF وتحتاج إلى أخذ الكتابة بداخله كنص عادي — ربما ستحمّله إلى أداة فحص الاقتباس، أو تلصقه في بريد إلكتروني، أو تعالجه بسكربت بايثون بسيط. بما أن صيغة PDF مصمَّمة للحفاظ على التخطيط البصري، فإن استخراج النص منها قد لا يكون بسيطًا كما يبدو. في هذا الدليل نشرح خطوة بخطوة تحويل PDF إلى TXT، ونتناول أيضًا الأخطاء النمطية التي تفسد النتيجة وكيفية تجنبها.
لماذا لا يخرج استخراج النص من PDF "نظيفًا" أحيانًا؟
لا يعمل PDF بمنطق الفقرة والسطر كما يعمل ملف معالج النصوص. بل يحتفظ بالمكان الدقيق الذي يجب أن يُرسَم فيه كل حرف على الصفحة. لذا عند تحويل PDF إلى نص عادي، تقرأ الأداة فعليًا مواضع الحروف على الصفحة وتحاول ترتيبها في تسلسل قراءة منطقي. يعمل هذا دون مشاكل في معظم الأحيان، لكن عندما يتعلق الأمر بصفحات متعددة الأعمدة أو جداول أو مستندات ممسوحة ضوئيًا (قائمة على الصورة)، قد يبدو الناتج مختلفًا عما تتوقعه. تساعدك الخطوات التالية في تقليل هذه الفروقات إلى أدنى حد.
خطوة بخطوة: تحويل PDF إلى TXT
1. جهّز ملفك
معرفة نوع ملف PDF الذي بحوزتك قبل التحويل تسهّل عملك:
- PDF قائم على النص: ملفات مُنتَجة عبر "حفظ كـPDF" من برنامج مثل Word أو مستندات Google. تحتوي هذه الملفات أصلًا على طبقة نص، ويعطي الاستخراج منها نتيجة سريعة وصحيحة.
- PDF ممسوح ضوئيًا/صورة: ملفات نتجت عن ماسح ضوئي أو صورة، وهي في الواقع صورة للصفحة. رغم وجود كتابة ظاهرة في هذا النوع من الملفات، لا توجد تحتها طبقة نص قابلة للتحديد.
افتح ملفك وجرّب تحديد كلمة بداخله بالماوس. إذا استطعت التحديد فهذا يعني وجود طبقة نص؛ وإذا لم تستطع، فلديك ملف PDF قائم على الصورة، وسيعطيك الاستخراج المباشر نتيجة فارغة أو بلا معنى.
2. افتح الأداة وارفع ملفك
عند فتح أداة PDF ← TXT، يمكنك سحب ملفك وإفلاته أو اختياره من جهازك. بعد رفع الملف، تبدأ الأداة بمسح طبقة النص صفحة صفحة لاستخراج المحتوى.
3. حدد نطاق الصفحات (عند الحاجة)
إذا كان لديك تقرير من 200 صفحة لكنك مهتم فقط بالجزء بين الصفحتين 12-18، فإن تحديد نطاق الصفحات المعني بدلًا من تحويل الملف بأكمله يسرّع العملية ويمنع إطالة الملف الناتج بلا داعٍ.
4. ابدأ التحويل
عند بدء العملية، تقرأ الأداة مواضع الحروف في البنية الداخلية لـPDF وتحوّلها إلى أسطر وفقرات. في المستندات الصغيرة تستغرق هذه العملية بضع ثوانٍ؛ وقد تستغرق أطول قليلًا في الملفات كثيرة الصفحات أو الغنية بالصور.
5. نزّل الناتج وراجعه
عند انتهاء العملية، تحصل على ملف .txt. نوصي بإلقاء نظرة سريعة عليه بعد تنزيله قبل لصقه مباشرة في مكان آخر — تحقق خصوصًا من ترتيب الأسطر في المستندات التي تحتوي على جداول أو صفحات متعددة الأعمدة، للتأكد من أنه كما تتوقع.
6. نظّف الملف عند الحاجة
قد ترى في النص الناتج أرقام صفحات، أو نصوص ترويسة/تذييل متكررة، أو مسافات غريبة عند نهايات الأسطر. تنتج هذه عن التصميم الأصلي لـPDF، وليست خطأ من الأداة. يمكنك تنظيف هذه العناصر المتكررة بسرعة باستخدام "بحث واستبدال" في محرر النصوص لديك.
نصائح عملية
- كن صبورًا مع الملفات الكبيرة. تتطلب المستندات التقنية ذات مئات الصفحات، أو ملفات PDF الغنية بالرسومات، وقت معالجة أطول مقارنة بنص من بضع صفحات.
- تحقق من الترميز. قد تظهر الأحرف غير اللاتينية (ş، ğ، ı، ö، ü، ç) أحيانًا مشوَّهة في ملفات PDF القديمة التي تستخدم ترميزات خط مختلفة. فتح الناتج في محرر نصوص يدعم UTF-8 (مثل VS Code أو Notepad++ بدلًا من المفكرة) يحل هذه المشكلة عادةً.
- انتبه للصفحات متعددة الأعمدة. في ملف PDF ذي عمودين بصيغة الصحف، قد تقرأ أدوات استخراج النص أحيانًا الأعمدة سطرًا سطرًا بدلًا من من اليسار لليمين، فتختلط. إذا كنت تعمل مع مستند كهذا، راجع الناتج حتمًا.
- لا تتوقع أن تبقى الجداول جداول. عندما يُفرَّغ جدول في نص عادي، تتحول الخلايا إلى أسطر مفصولة بمسافات أو علامات تبويب؛ لا تُحفَظ بنية الصف-العمود تلقائيًا. إذا كنت ستعمل مع بيانات الجدول، قد تحتاج لتعديل المصدر يدويًا.
- احتفظ بالملف الأصلي. ناتج TXT عملي للتحرير أو التحليل، لكنه يفقد التنسيق البصري (الخط العريض، الصور، تخطيط الصفحة). احتفظ دائمًا بملف PDF الأصلي كنسخة احتياطية.
الأخطاء والمزالق الشائعة
"لم يخرج نص، جاء الملف فارغًا." على الأرجح أن ملف PDF الذي بحوزتك صورة ممسوحة ضوئيًا ولا يحتوي طبقة نص قابلة للتحديد. في هذه الحالة يجب أولًا تطبيق التعرف الضوئي على الحروف (OCR)؛ لا تستطيع أداة استخراج النص العادي استخراج طبقة غير موجودة.
"خرجت الكلمات ملتصقة ببعضها." بعض أدوات إنتاج PDF تترك المسافات بين الكلمات كمسافة بصرية فقط، دون ترميزها كحرف مسافة حقيقي. يُلاحَظ هذا خصوصًا في الملفات القديمة أو المُعدَّة بخطوط خاصة. في حالات كهذه قد تحتاج لتصحيح الناتج يدويًا.
"ترتيب الأسطر مختلط، والجمل بلا معنى." يحدث هذا عادة في التخطيطات متعددة الأعمدة أو الصفحات ذات الصناديق الجانبية/الحواشي. لا يعني هذا أن الأداة قرأت الصفحة بشكل خاطئ؛ فقد تكون البنية الداخلية لـPDF نفسها تُعرِّف ترتيب قراءة مختلط.
"تحولت الأحرف غير اللاتينية إلى علامة استفهام أو مربع." ينتج هذا عادة عن فتح محرر النصوص لديك الملف بترميز خاطئ. جرّب إعادة فتح الملف بترميز UTF-8.
"لم أستطع رفع الملف." في ملفات PDF المشفَّرة أو ذات قيود التحرير، قد تحتاج لإزالة القيد أولًا. كذلك قد تعطي ملفات PDF التالفة أو غير المكتملة خطأً عند الرفع.
متى تختار TXT ومتى صيغة أخرى؟
إذا كان هدفك فقط قراءة النص أو البحث فيه أو إعطاءه كنص خام لأداة ذكاء اصطناعي، فـTXT مثالي — صيغة صغيرة، سريعة الفتح، تعمل دون مشاكل على كل منصة. لكن إذا كنت بحاجة للحفاظ على التنسيق (العناوين، الخط العريض، بنية الجدول)، يجب أن تفكر في التحويل إلى صيغة مستند قابل للتحرير بدلًا من TXT؛ في هذه الحالة يعطيك TXT المحتوى الخام فقط، لا البنية البصرية.
الخلاصة
استخراج نص عادي من PDF عملية بسيطة غالبًا ما تكتمل بضغطات قليلة، لكن معرفة نوع ملفك (قائم على النص أم ممسوح ضوئيًا) مسبقًا ومراجعة الناتج تسهّل عليك الحصول على أفضل نتيجة. باتباع الخطوات أعلاه، توفّر الوقت وتستمر في العمل مع ملف نصي نظيف وقابل للاستخدام.
الأسئلة الشائعة
تظهر الأحرف غير اللاتينية مشوَّهة في النص الذي استخرجته من PDF، ماذا أفعل؟
غالبًا ما يتعلق هذا بإعداد الترميز في محرر النصوص الذي فتحت به الملف. جرّب فتح ملف TXT مجددًا في محرر يدعم UTF-8 (مثل VS Code أو Notepad++). إذا استمرت المشكلة، فقد يكون PDF نفسه يستخدم ترميز خط قديمًا؛ في هذه الحالة قد تحتاج لتصحيح بعض الأحرف الخاصة يدويًا.
هل يمكنني تحويل ملف PDF ممسوح ضوئيًا (يشبه الصورة) إلى TXT؟
يقرأ استخراج النص العادي طبقة النص الموجودة داخل PDF. بما أنه لا توجد طبقة كهذه في المستندات الممسوحة ضوئيًا، يعطي الاستخراج المباشر نتيجة فارغة أو بلا معنى. في هذا النوع من الملفات يجب أولًا تطبيق التعرف الضوئي على الحروف (OCR)، ثم أخذ النص الناتج كـTXT.
هل يمكنني تحويل صفحات معينة فقط من ملف PDF متعدد الصفحات إلى نص؟
نعم، يمكنك استخراج القسم الذي تحتاجه فقط بتحديد نطاق الصفحات قبل التحويل. هذا يقلل وقت المعالجة ويمنع تراكم محتوى غير ضروري في الملف الناتج.
جرّب ذلك الآن باستخدام PDF → TXT.
جرّب PDF → TXT