استخراج متن فارسی از PDF با ترتیب درست
متن فارسی PDF را همانطور که خوانده میشود کپی کنید: کلمات سالم و بهترتیب.
- بدون آپلود
- رایگان
- بدون محدودیت
فایلها را اینجا بکشید و رها کنید
فایلهای PDF · یک یا چند فایل
پردازش روی دستگاه شما — هیچ چیزی آپلود نمیشود
میتوانید با Ctrl+V هم جایگذاری کنید
روش کار
- فایل PDF را اضافه کنید.
- روی «استخراج متن» بزنید.
- متن را کپی کنید یا بهصورت فایل TXT دانلود کنید.
دربارهٔ این ابزار
بسیاری از فایلهای PDF متن فارسی را همانطور که روی صفحه کشیده شده ذخیره میکنند: شکل حروف از چپ به راست. برای همین کپی مستقیم، کلمات را برعکس و با حروف جدا تحویل میدهد و جستوجو، غلطیاب و چسباندن در Word کار نمیکند. ورقه جای هر حرف روی صفحه را میخواند و متن را به ترتیب خواندن و با حروف واقعی فارسی بازسازی میکند؛ نیمفاصلهها و «ی» و «ک» فارسی هم درست میمانند. در آزمایش ما روی فایلی فارسی و اردو که Word ساخته بود، ۹۶٪ کلمات درست و بهترتیب درآمدند، در حالی که کپی مستقیم هیچ کلمهای را درست نداد. همهچیز در مرورگر شما انجام میشود و فایل آپلود نمیشود.
کارهای پرکاربرد
چرا ورقه برای این کار؟
پرسشهای پرتکرار
چرا متن فارسی هنگام کپی از PDF برعکس میشود؟
چون برخی برنامهها مثل Word و مرورگرها شکلهای متصل حروف را به ترتیب رسمشان، از چپ به راست، در PDF مینویسند و نمایشگرهای PDF همان را کپی میکنند. ورقه آنها را بر اساس جایشان روی صفحه دوباره مرتب میکند و شکلهای نمایشی را به حروف اصلی برمیگرداند.
برای PDF اسکنشده هم کار میکند؟
فایل اسکنشده تصویر است و متنی ندارد. ابتدا با ابزار OCR و انتخاب زبان فارسی، متن را از تصویر استخراج کنید.
فایلهای من امن هستند؟
بله. اصلاً سروری وجود ندارد که فایلهای شما را دریافت کند؛ همهٔ پردازش در مرورگر انجام میشود و فایلها روی دستگاه شما میمانند. میتوانید این را در بخش Network ابزار توسعهدهنده ببینید.
واقعاً رایگان است؟
بله، همهٔ ابزارها رایگاناند؛ بدون سقف روزانه، بدون ثبتنام و بدون واترمارک روی فایلها.
روی گوشی هم کار میکند؟
بله، در هر مرورگر بهروز روی گوشی و رایانه کار میکند و میتوانید آن را از منوی مرورگر مثل برنامه نصب کنید.