OCR

استخرج النص من المستندات الممسوحة والصور

المستند الممسوح ضوئيًا هو صورة للنص، لذلك لا يعمل عليه النسخ ولا البحث ولا التحديد. يقوم OCR بقراءة الحروف واستعادتها. تحصل إما على النص العادي، أو على المستند نفسه مع طبقة نص غير مرئية مضافة إليه ليتصرف كملف PDF عادي.

  • ملفات PDF ممسوحة ضوئيًا وصور، حتى 200 صفحة
  • سبع لغات، من بينها الروسية واليابانية والصينية
  • PDF القابل للبحث يبقي شكل الصفحات كما هو تمامًا
  • تُحذف الملفات تلقائيًا — 24 ساعة في الخطة المجانية، و7 أيام في الخطط المدفوعة

PDF أو PNG أو JPG أو TIFF أو BMP أو GIF أو WebP أو HEIC.

اختر اللغة الموجودة فعليًا في الصفحة. اللغة الخاطئة لا تسبب فشلًا — بل تُرجع كلامًا بلا معنى.

المُخرَج

النص المتعرَّف عليه، جاهز للنسخ.

كيف تستخرج النص من مستند ممسوح ضوئيًا

  1. 01

    ارفع الملف الممسوح أو الصورة

    اختر ملف PDF ممسوحًا ضوئيًا أو صورة للصفحة. تُقرأ ملفات PDF متعددة الصفحات صفحةً صفحة، بالترتيب.

  2. 02

    اختر اللغة

    اختر اللغة التي كُتب بها المستند فعليًا. هذا أهم مما يبدو: اللغة الخاطئة لا تنتج خطأً، بل تنتج كلامًا واثقًا بلا معنى.

  3. 03

    اختر نصًا عاديًا أو PDF قابلًا للبحث

    النص العادي يمنحك الحروف لنسخها. أما PDF القابل للبحث فيُرجع الصفحات الأصلية مع طبقة نص مخفية، فيبقى الملف بالشكل نفسه لكن يمكن البحث فيه وتحديده.

  4. 04

    اقرأ النتيجة أو نزّلها

    يظهر النص على الصفحة جاهزًا للنسخ؛ أما PDF القابل للبحث فيُنزَّل مباشرة.

ما الذي يؤثر في الدقة

الدقة. تُعرَض الصفحات بدقة 300 DPI قبل القراءة، وهو المستوى الذي توصي به وثائق Tesseract نفسها. الصورة الملتقطة من بعيد، أو المسح الضوئي بدقة 100 DPI، تترك للمحرك مادة أقل ليعمل عليها.

الاستقامة ووضوح التركيز. الصفحة المصورة بزاوية مائلة، أو التي ينحني نصها قرب كعب الكتاب، تُقرأ أسوأ بوضوح من مسح ضوئي مستوٍ.

اللغة. لكل لغة نموذجها المدرَّب الخاص. تمرير نص سيريلي أو ياباني عبر النموذج الإنجليزي يُرجع هراءً يبدو سليمًا بدل أن يُرجع خطأً، ولهذا لا تعرض القائمة سوى اللغات التي يستطيع الخادم تحميلها فعلًا.

ما لا يفعله OCR. لا يُحفَظ التخطيط: الأعمدة والجداول والعناوين تعود كنص متصل بترتيب القراءة. وإذا كان ملف PDF الأصلي يحتوي أصلًا على طبقة نص، فإن تحويله إلى نص يستخدم تلك الطبقة بدلًا من ذلك — بدقة تامة وفوريًا، وبنتيجة أفضل من أي OCR.

فيمَ يستخدمه الناس

العقود والفواتير

ملف PDF موقَّع وصل كمستند ممسوح ضوئيًا، يتحول إلى ملف قابل للبحث ليمكن العثور على رقم مرجعي فيه لاحقًا.

الإيصالات المصوّرة بالهاتف

استخرج المبالغ والتواريخ من صورة بدل إعادة كتابتها يدويًا.

المستندات القديمة والأرشيفات

سجلات ورقية مُسحت ضوئيًا قبل سنوات، تصبح قابلة للبحث دون تغيير شكل الصفحات.

لقطات الشاشة والشرائح

استعد النص من صورة فُقد ملفها الأصلي منذ زمن.

الأسئلة الشائعة

ما هو PDF القابل للبحث؟

هو ملف PDF يبدو تمامًا مثل المستند الممسوح الذي رفعته، مع طبقة غير مرئية من النص المتعرَّف عليه موضوعة فوق الكلمات. تبقى الصفحات دون تغيير بصريًا، لكن يمكنك الآن تحديدها ونسخها والبحث فيها، وكذلك تستطيع البرامج الأخرى.

ما اللغات المدعومة؟

الإنجليزية والروسية والفرنسية والألمانية والإسبانية واليابانية والصينية المبسطة. تعرض القائمة بالضبط ما يستطيع الخادم تحميله — ولا تقدّم أبدًا لغة قد تنتج كلامًا بلا معنى دون تنبيه.

كم عدد الصفحات التي يمكنه معالجتها؟

حتى 200 صفحة لكل ملف. تُعرَض كل صفحة وتُقرأ على حدة، لذا يستغرق المستند الطويل وقتًا أطول بالتناسب.

هل دقة OCR كافية للاعتماد عليها؟

بالنسبة لمسح ضوئي نظيف ومستقيم لنص مطبوع، الدقة عالية جدًا. أما الكتابة اليدوية والصور منخفضة الدقة والصفحات المائلة والخطوط غير المألوفة فنتائجها أسوأ بكثير. تحقق دائمًا من الأرقام المهمة — فأخطاء OCR تبدو كنص معقول، لا كأخطاء ظاهرة.

هل تحتفظون بمستندي؟

ليس أطول من مدة الاحتفاظ في خطتك: 24 ساعة في الخطة المجانية وللزوار بلا حساب، و7 أيام في الخطط المدفوعة. يُنقل الملف عبر TLS ولا يُستخدم في أي شيء سوى إنتاج نتيجتك.

ملف PDF لدي يحتوي أصلًا على نص قابل للتحديد. هل أحتاج إلى OCR؟

لا. إذا كان ملف PDF يحتوي أصلًا على طبقة نص، فإن تحويله إلى نص يستخدم تلك الطبقة مباشرة، وهو دقيق وفوري. لا يعمل OCR إلا حين لا يكون هناك ما يمكن استخراجه — أي حين تكون الصفحة مجرد صورة فعلًا.