انتقل إلى المحتوى
WoowPDF

OCR لملفات PDF – اجعل المستندات الممسوحة قابلة للبحث

اجعل ملفات PDF الممسوحة ضوئياً والصور قابلة للبحث عبر OCR بـ 15 لغة. احصل على PDF قابل للبحث أو نص عادي، داخل متصفحك ودون رفع.

مجاني تعمل داخل متصفحك

كيفية إجراء OCR لملف PDF ممسوح عبر الإنترنت

المستند الممسوح ضوئياً مجرد صورة للصفحة: لا يمكنك البحث فيه أو تحديد جملة أو نسخ رقم منه. تقرأ أداة التعرف الضوئي على الحروف (OCR) في PDF الحروف الموجودة في تلك الصورة وتحوّلها إلى نص حقيقي. يمكنك الإبقاء على الشكل الأصلي وإضافة طبقة نصية غير مرئية لتحصل على PDF قابل للبحث، أو تنزيل النص المتعرَّف عليه فقط في ملف .txt. يتم التعرف داخل متصفحك باستخدام محرك Tesseract مفتوح المصدر، فلا يغادر المستند جهازك.

كيفية إجراء OCR لملف PDF

  1. أضف ملف PDF ممسوحاً أو صورة (PDF أو JPG أو PNG أو WebP أو BMP حتى 100 ميغابايت)، ويمكنك لصق لقطة شاشة بـ Ctrl+V.
  2. اختر لغة المستند، وهي افتراضياً لغة هذه الصفحة، وأضف لغة ثانية إذا كان المستند ثنائي اللغة، مثل العربية والإنجليزية.
  3. اختر الناتج: PDF قابل للبحث أو نص عادي. في ملفات PDF يمكنك تحديد صفحات معينة مثل 1-3, 7.
  4. انقر على التعرف على النص. في أول مرة تُنزَّل بيانات اللغة ثم تُحفظ مؤقتاً للمرات القادمة، ويظهر التقدم صفحة بصفحة.
  5. نزّل الملف-ocr.pdf أو الملف.txt.

اللغات المدعومة

الإنجليزية والفرنسية والإسبانية والألمانية والإيطالية والبرتغالية والروسية والعربية والهندية والصينية المبسطة والتقليدية واليابانية والكورية والتركية والأردية. اختيار اللغة الصحيحة أساسي، فهو يخبر المحرك بالأبجدية والكلمات المتوقعة. لا تضف لغة ثانية إلا إذا كان المستند يحتويها فعلاً، لأن كل لغة إضافية تبطئ العملية.

كيف يبدو PDF القابل للبحث؟

لا تُعدَّل صفحاتك ولا يُعاد ضغطها. تُعرض كل صفحة بدقة تصل إلى 300 DPI للتعرف، ثم توضع الكلمات المتعرَّف عليها كطبقة غير مرئية فوق الكلمات المطبوعة تماماً. يبدو المستند كما هو، لكن Ctrl+F يجد الكلمات، ويمكنك التظليل والنسخ، وتستطيع أنظمة البحث فهرسة الملف.

ما مدى الدقة؟

  • أفضل النتائج: نص مطبوع واضح ممسوح بدقة 300 DPI وصفحات مستقيمة وتباين جيد.
  • نتائج أضعف: صور الهاتف الضبابية والخط الصغير جداً والصفحات المائلة والخلفيات الملونة والخطوط الزخرفية.
  • غير مناسب: الكتابة اليدوية، إذ لا يقرؤها Tesseract بشكل موثوق.
  • تحتاج العربية والهندية والصينية عادة إلى مسح أوضح من الحروف اللاتينية للوصول إلى الدقة نفسها، فراجع النص جيداً.

نصائح وأدوات ذات صلة

  • تصوّر مستندات ورقية؟ تقوم أداة المسح الضوئي إلى PDF بتقويم الصفحات وتنظيفها قبل OCR.
  • للحصول على نص منظم، حوّل PDF القابل للبحث بعد ذلك عبر PDF إلى Markdown.
  • إذا كان الملف يحتوي أصلاً على نص قابل للتحديد، فإن مستخرج نص PDF أسرع وأدق.

خاص ومجاني

يتم التعرف على حاسوبك أو هاتفك، فلا تُرسل العقود أو بطاقات الهوية أو التقارير الطبية إلى WoowPDF، ولا يُنزَّل سوى نموذج اللغة. لا تسجيل ولا حد يومي ولا علامة مائية. تعتمد السرعة على جهازك: بضع ثوانٍ للصفحة على حاسوب محمول.

المزايا

  • OCR بـ 15 لغة مع لغة ثانية اختيارية
  • PDF قابل للبحث بطبقة نصية غير مرئية
  • تصدير نص عادي (.txt) مع علامات الصفحات
  • ملفات PDF ممسوحة وصور JPG وPNG وWebP وBMP
  • كل الصفحات أو نطاق مختار
  • داخل المتصفح دون رفع الملف

الأسئلة الشائعة

ما هو OCR لملفات PDF؟

التعرف الضوئي على الحروف يقرأ النص في الصفحات الممسوحة أو المصورة ويحوّله إلى حروف حقيقية يمكن البحث فيها ونسخها.

هل يُرفع مستندي الممسوح؟

لا. يتم التعرف في متصفحك باستخدام Tesseract، ولا تُنزَّل إلا بيانات اللغة مرة واحدة.

ما اللغات المدعومة؟

الإنجليزية والفرنسية والإسبانية والألمانية والإيطالية والبرتغالية والروسية والعربية والهندية والصينية المبسطة والتقليدية واليابانية والكورية والتركية والأردية، مع إمكانية الجمع بين لغتين.

ما الفرق بين PDF القابل للبحث والنص العادي؟

يحتفظ PDF القابل للبحث بصفحاتك ويضيف فوقها طبقة نصية غير مرئية، أما النص العادي فيعطيك الكلمات فقط في ملف .txt.

هل يقرأ الكتابة اليدوية؟

ليس بشكل موثوق، فالمحرك مدرَّب على النص المطبوع.

كيف أحسّن دقة التعرف؟

استخدم مسحاً واضحاً بدقة 300 DPI تقريباً وصفحات مستقيمة واختر اللغة الصحيحة دون لغات إضافية غير ضرورية.

ليس ما تحتاجه تمامًا؟