টিউটোরিয়াল
স্ক্যান করা PDF থেকে কীভাবে টেক্সট এক্সট্র্যাক্ট করবেন
একটি স্ক্যান করা PDF হলো লেখার একটি ছবি, তাই আপনি এটি সিলেক্ট, সার্চ, কপি বা অনুবাদ করতে পারবেন না। DocTranslating-এর OCR PDF টুল মাত্র কয়েকটি ক্লিকেই স্ক্যান করা বা ছবি-ভিত্তিক PDF-কে আসল, সিলেক্টযোগ্য টেক্সট লেয়ারে রূপান্তর করে: টুলটি খুলুন, আপনার স্ক্যান ফাইলটি আপলোড করুন, দ্রুত ও নির্ভুল ফলাফলের জন্য ইচ্ছে হলে ডকুমেন্টের ভাষা সেট করুন এবং 'টেক্সট এক্সট্র্যাক্ট করুন'-এ ক্লিক করুন। এটি ৫০টিরও বেশি ভাষা, হাতে লেখা টেক্সট এবং আরবি ও হিব্রুর মতো ডান-থেকে-বাম (RTL) ভাষার স্ক্রিপ্ট সমর্থন করে। একবার OCR করা PDF পেয়ে গেলে, আপনি যেকোনো সাধারণ ডকুমেন্টের মতোই এটি অনুবাদ করতে, অনুসন্ধান করতে বা এটি থেকে টেক্সট কপি করতে পারবেন।
সর্বশেষ পরিমার্জন ১৯ জুন, ২০২৬ · 8 মিনিট পড়ার সময়
আপনি যদি কোনো PDF-এ টেক্সট সিলেক্ট করার চেষ্টা করেন এবং কিছুই হাইলাইট না হয়, অথবা Ctrl+F দিয়ে সার্চ করার পর কোনো ফলাফল না পান, তবে আপনার PDF-টি স্ক্যান করা — এটি পেজের একটি ছবি, টেক্সট নয়। এ কারণেই এটি অনুবাদ করা, কপি করা বা এডিট করা যায় না। এর সমাধান হলো OCR (অপ্টিক্যাল ক্যারেক্টার রিকগনিশন), যা ছবি পড়ে এবং এর নিচে একটি আসল টেক্সট লেয়ার তৈরি করে। এই গাইডে দেখানো হয়েছে কীভাবে DocTranslating-এর OCR PDF টুলের মাধ্যমে এই কাজটি করবেন এবং ফলাফলের পর কী করবেন।
আমার PDF-টি স্ক্যান করা কি না তা কীভাবে বুঝব?
তিনটি দ্রুত পরীক্ষার মাধ্যমে বুঝতে পারবেন আপনার PDF-এ OCR প্রয়োজন কিনা:
- একলাইন টেক্সট সিলেক্ট করার চেষ্টা করুন। আপনার কার্সার যদি আলাদা শব্দ হাইলাইট করতে না পারে — অথবা পুরো পেজটিকে একটি ছবি হিসেবে সিলেক্ট করে — তবে এটি স্ক্যান করা।
- Ctrl+F (Mac-এ Cmd+F) দিয়ে সার্চ করুন। আপনি স্পষ্ট দেখতে পাচ্ছেন এমন কোনো শব্দ লিখে সার্চ করার পরও যদি কোনো রেজাল্ট না আসে, তাহলে সার্চ করার মতো কোনো টেক্সট লেয়ার এতে নেই।
- ইন-অ্যাপ নোটিশটি দেখুন। DocTranslating-এ একটি স্ক্যান করা ফাইল ওপেন করলে, একটি ব্যানার মেসেজ ভেসে ওঠে: "এই ডকুমেন্টটি স্ক্যান করা বলে মনে হচ্ছে…" সাথে থাকে একটি OCR PDF টুল খুলুন বাটন — অ্যাপটি ধরে ফেলেছে যে এতে কোনো ব্যবহারযোগ্য টেক্সট লেয়ার নেই।
ধাপে ধাপে: স্ক্যান করা PDF থেকে টেক্সট এক্সট্র্যাক্ট করুন
- 1
OCR PDF টুলটি খুলুন
সরাসরি OCR PDF টুলে যান, অথবা — আপনি যদি ইতিমধ্যেই কোনো স্ক্যান করা ফাইল অনুবাদ করার চেষ্টা করে থাকেন — "এই ডকুমেন্টটি স্ক্যান করা বলে মনে হচ্ছে" নোটিশের "OCR PDF টুল খুলুন" বাটনে ক্লিক করুন। উভয় পদ্ধতিতেই একই টুল খুলবে।
- 2
আপনার স্ক্যান করা PDF আপলোড করুন
আপনি যে স্ক্যান করা বা ছবি-ভিত্তিক PDF রূপান্তর করতে চান তা সিলেক্ট করুন। এটি সেই ফাইল যেখান থেকে বর্তমানে টেক্সট সিলেক্ট বা সার্চ করা যাচ্ছে না।
- 3
ইচ্ছে হলে ডকুমেন্টের ভাষা নির্ধারণ করুন
আপনি যদি ডকুমেন্টের ভাষা জেনে থাকেন তবে তা সেট করে দিন। এটি ঐচ্ছিক — টুলটি স্বয়ংক্রিয়ভাবে ভাষা সনাক্ত করে — তবে ভাষা নির্ধারণ করে দিলে দ্রুত এবং আরও নির্ভুল ফলাফল পাওয়া যায়, বিশেষ করে আরবি, চাইনিজ, সিরিলিক বা দেবনাগরীর মতো অ-ল্যাটিন স্ক্রিপ্ট এবং হাতে লেখা টেক্সটের ক্ষেত্রে।
- 4
টেক্সট এক্সট্র্যাক্ট করুন-এ ক্লিক করুন এবং ফলাফল ডাউনলোড করুন
টুলটি পেজগুলো পড়ে এবং মূল ডকুমেন্টের চেহারা ঠিক রেখে একটি আসল, সিলেক্টযোগ্য টেক্সট লেয়ার তৈরি করে। OCR করা PDF-টি ডাউনলোড করুন — এখন আপনি এর টেক্সট সিলেক্ট করতে, সার্চ করতে ও কপি করতে পারবেন এবং এটি অনুবাদের জন্য প্রস্তুত।
OCR PDF টুল যেসব ক্ষেত্রে চমৎকার কাজ করে
DocTranslating-এর OCR সবচেয়ে সক্ষম ইঞ্জিনগুলোর একটি এবং এটি সাধারণ প্রিন্ট করা ইংরেজির চেয়ে আরও অনেক বেশি সুবিধা দেয়:
- ৫০টিরও বেশি ভাষা — অ-ল্যাটিন স্ক্রিপ্টযুক্ত ভাষা সহ।
- হাতে লেখা টেক্সট — কেবল প্রিন্ট করা লেখা নয়, স্পষ্ট হাতের লেখাও সনাক্ত করা যায়।
- ডান-থেকে-বাম (RTL) স্ক্রিপ্ট — সঠিক পড়ার ক্রমসহ আরবি, হিব্রু এবং ফার্সি ভাষা বেশ নির্ভুলভাবে প্রসেস করা হয়।
- মিশ্র-ভাষার পেজ — যেসব ডকুমেন্টের একটি পেজে একাধিক ভাষা থাকে।
- দৈনন্দিন স্ক্যানের মান — ডকুমেন্টের ছবি এবং সাধারণ অফিসের স্ক্যান ফাইল, কেবল একদম নিখুঁত ফ্ল্যাটবেড স্ক্যান নয়।
OCR প্রসেসের পর: আপনার ডকুমেন্ট অনুবাদ করুন
একবার OCR করা PDF পেয়ে গেলে, এটি অনুবাদ করা যেকোনো সাধারণ PDF অনুবাদ করার মতোই সহজ — এটি আপলোড করুন, ভাষা এবং একটি অনুবাদ ইঞ্জিন সিলেক্ট করুন এবং অনুবাদ করা কপিটি ডাউনলোড করুন। আলাদা ধাপ হিসেবে প্রথমে OCR রান করার একটি বড় সুবিধা রয়েছে: আপনি অনুবাদ করার আগেই এক্সট্র্যাক্ট করা টেক্সট পড়ে তা সঠিক কিনা নিশ্চিত হতে পারবেন। কোনো অসংशोधিত স্ক্যান অনুবাদ করলে দু ধরনের ভুল তৈরি হওয়ার ঝুঁকি থাকে — একটি ভুলভাবে পড়া শব্দ আত্মবিশ্বাসের সাথে একটি ভুল অনূদিত শব্দে পরিণত হয় — তাই প্রথম ধাপে OCR আউটপুট পরীক্ষা করে নেওয়াটাই নির্ভুল চুড়ান্ত অনুবাদ পাওয়ার সবচেয়ে সেরা উপায়।
সেরা OCR ফলাফলের জন্য কিছু টিপস
OCR-এর নির্ভুলতা মূলত স্ক্যান ফাইলের মানের ওপর নির্ভর করে। কিছু বিষয় লক্ষণীয়ভাবে ফলাফল উন্নত করে:
- জানলে ডকুমেন্টের ভাষা সেট করে দিন — সঠিকতা এবং প্রসেসিং স্পিড বাড়ানোর জন্য এটি সবচেয়ে সহজ উপায়।
- পরিষ্কার, সোজা স্ক্যান ব্যবহার করুন। বাঁকা বা ঘোড়ানো পেজগুলো পুনরায় স্ক্যান করুন যেন টেক্সটগুলো সমান্তরাল লাইনে থাকে।
- উচ্চ রেজোলিউশনকে প্রাধান্য দিন। ৩০০ DPI বা তার বেশি রেজোলিউশনের স্ক্যান লো-রেজোলিউশনের ছবির তুলনায় OCR কে কাজ করার জন্য আরও স্পষ্ট অক্ষর দেয়।
- ঝাপসা ডকুমেন্টের কনট্রাস্ট বাড়ান যেন টেক্সট ব্যাকগ্রাউন্ড থেকে স্পষ্টভাবে ফুটে ওঠে।
- ফাইলটি পাসওয়ার্ড-সুরক্ষিত নয় তা নিশ্চিত করুন — এনক্রিপ্ট করা PDF আনলক না করা পর্যন্ত পড়া যায় না।
বিকল্প: PDFEquips-এ OCR
আপনি যদি ইতিমধ্যেই PDFEquips-এর ভেতরে কাজ করছেন — উদাহরণস্বরূপ PDF কনভার্ট, কমপ্রেস বা মার্জ করছেন — তবে এতে একটি OCR টুলও রয়েছে যা আপনি স্ক্যান করা PDF সার্চযোগ্য করতে ব্যবহার করতে পারেন। যেকোনো পদ্ধতিতেই আপনি একটি OCR করা ফাইল পাবেন যা পরবর্তীতে অনুবাদের জন্য DocTranslating-এ নিয়ে আসতে পারেন। আপনার ওয়ার্কফ্লোর সাথে যেটি সুবিধা হয় সেটি ব্যবহার করুন।
সচরাচর জিজ্ঞাস্য প্রশ্নাবলী (FAQ)
স্ক্যান করা PDF থেকে কীভাবে টেক্সট এক্সট্র্যাক্ট করব?
DocTranslating-এর OCR PDF টুল খুলুন, আপনার স্ক্যান করা PDF আপলোড করুন, দ্রুত ও নির্ভুল ফলাফলের জন্য ইচ্ছে হলে ডকুমেন্টের ভাষা সেট করুন এবং 'টেক্সট এক্সট্র্যাক্ট করুন'-এ ক্লিক করুন। টুলটি মূল ডকুমেন্টের চেহারা ঠিক রেখে একটি আসল, সিলেক্টযোগ্য টেক্সট লেয়ার তৈরি করে এবং একটি OCR করা PDF ডাউনলোড করার সুযোগ দেয় যা আপনি সিলেক্ট, সার্চ, কপি এবং অনুবাদ করতে পারেন।
একটি PDF স্ক্যান করা নাকি আসল টেক্সট রয়েছে তা কীভাবে বুঝব?
আপনার কার্সার দিয়ে টেক্সটের একলাইন সিলেক্ট করার চেষ্টা করুন, অথবা Ctrl+F (Mac-এ Cmd+F) দিয়ে ডকুমেন্ট অনুসন্ধান করুন। আপনি যদি আলাদা শব্দ হাইলাইট করতে না পারেন, অথবা স্পষ্ট দৃশ্যমান শব্দ লিখে সার্চ করার পরও কোনো ফলাফল না পান, তাহলে PDF-টি স্ক্যান করা এবং এতে OCR প্রয়োজন। DocTranslating-এ কোনো স্ক্যান করা ফাইল ওপেন করলে "এই ডকুমেন্টটি স্ক্যান করা বলে মনে হচ্ছে" নোটিশের সাথে "OCR PDF টুল খুলুন" বাটন ভেসে ওঠে।
এটি কি PDF থেকে হাতে লেখা টেক্সট এক্সট্র্যাক্ট করতে পারে?
হ্যাঁ। OCR PDF টুলটি প্রিন্ট করা লেখার পাশাপাশি হাতে লেখা টেক্সটও সনাক্ত করতে পারে। পরিষ্কার, পঠনযোগ্য হাতের লেখা সবচেয়ে ভালো ফলাফল দেয়; খুব অস্পষ্ট বা স্টাইলিশ হাতের লেখা যেকোনো OCR সিস্টেমের জন্যই কঠিন, তাই পঠনযোগ্যতার ওপর ভিত্তি করে ফলাফল ভিন্ন হতে পারে।
OCR কি আরবি, হিব্রু এবং অন্যান্য ডান-থেকে-বাম ভাষার জন্য কাজ করে?
হ্যাঁ। OCR PDF টুলটি আরবি, হিব্রু এবং ফার্সি সহ ডান-থেকে-বাম (RTL) ভাষার স্ক্রিপ্ট সমর্থন করে এবং সঠিক পঠন ক্রম পুনর্গঠন করে — যা সাধারণত স্ক্যান করা RTL ডকুমেন্টের ক্ষেত্রে সবচেয়ে কঠিন অংশ। ফলে এক্সট্র্যাক্ট করা টেক্সট উলটপালট না হয়ে অনুসন্ধান ও অনুবাদের উপযোগী হয়।
OCR PDF টুলটি কতগুলো ভাষা সমর্থন করে?
৫০টিরও বেশি ভাষা, যার মধ্যে অনেক অ-ল্যাটিন স্ক্রিপ্টযুক্ত ভাষা রয়েছে। আপনি টুলটিকে স্বয়ংক্রিয়ভাবে ভাষা সনাক্ত করতে দিতে পারেন, অথবা দ্রুত ও নির্ভুল এক্সট্র্যাকশনের জন্য ম্যানুয়ালি সেট করতে পারেন — অ-ল্যাটিন এবং হস্তলিখিত ডকুমেন্টের ক্ষেত্রে ভাষা নির্ধারণ করে দেওয়া বিশেষভাবে সহায়ক।
স্ক্যান করা PDF অনুবাদ করার আগে কি আমাকে OCR চালাতে হবে?
এটিই সুপারিশকৃত পদ্ধতি। প্রথম ধাপ হিসেবে আলাদাভাবে OCR চালালে আপনি অনুবাদ করার আগেই এক্সট্র্যাক্ট করা টেক্সট সঠিক কিনা তা পরীক্ষা করতে পারেন, যাতে সনাক্তকরণের ভুল অন্য ভাষায় স্থানান্তরিত না হয়। একবার OCR করা PDF পেয়ে গেলে, যেকোনো সাধারণ PDF-এর মতোই তা অনুবাদ করতে পারবেন।
OCR কি আমার ডকুমেন্টের চেহারায় পরিবর্তন আনবে?
না — OCR PDF টুলটি ডকুমেন্টের মূল চেহারা বজায় রাখে এবং এতে একটি সিলেক্টযোগ্য টেক্সট লেয়ার যুক্ত করে। আপনার স্ক্যান ফাইলটি দেখতে আগের মতোই থাকবে; পার্থক্য কেবল এটাই যে এখন এর টেক্সট সিলেক্ট, সার্চ, কপি ও অনুবাদ করা যাবে।
কেন গুগল অনুবাদ বা অন্যান্য টুল আমার স্ক্যান করা PDF অনুবাদ করতে পারে না?
অধিকাংশ অনুবাদক কেবল PDF-এর বিদ্যমান টেক্সট লেয়ার পড়তে পারে, আর একটি স্ক্যান করা PDF-এ এমন কোনো লেয়ার থাকে না — এটি কেবল একটি ছবি। এ কারণেই তারা একটি খালি ফাইল বা এরর মেসেজ দেয়। প্রথমে OCR দিয়ে টেক্সট এক্সট্র্যাক্ট করলে ডকুমেন্টটি একটি আসল টেক্সট লেয়ার পায়, যার পর এটি স্বাভাবিকভাবে অনুবাদ করা যায়।