1Nahrajte naskenovaný PDF documents; čistý 300 DPI šedý sken dává rozpoznávači nejvíce pracovat.
2Řekni mu, který jazyk očekávat? jméno jazyk beats nechat ho hádat o široké rozpětí.
3Spusťte rozpoznávací pas; slova jsou napsána zpět jako neviditelná vrstva, která sedí nad originálním obrazem stránky.
4Stáhněte si vyhledávací soubor PDF? vypadá stejně, ale nyní můžete hledat a vyberte text v něm.
OCR PDF Často kladené otázky
Ovlivňuje zdrojový formát rozpoznávání?
+
To ano. PDF opraví stránku: písma, vektory, rastrové obrázky a textové souřadnice jsou zmraženy, takže každý čtenář vidí stejné rozložení. Jak je stránka uložena, rozhoduje o tom, s jakým rozlišením a barevnými informacemi musí rozpoznávač pracovat.
Něco konkrétního pro PDF tady?
+
Ano, PDF je graf objektu, ne obrázek stránky, takže text zůstane volitelný a vektory zůstanou ostré bez ohledu na to, co se stane s rastrovým obsahem uvnitř. To ovlivňuje to, co rozpoznávač může vidět.
Jak je to přesné?
+
Na čistém 300 DPI skenování tištěného textu, dostatečně vysoké, že chyby jsou vzácné a většinou v neobvyklých řádných jmen. Přesnost padá prudce s nízkým rozlišením, zkosení, stíny z telefonní kamery, neobvyklé písma a rukopisu?
Na co bych měl skenovat nejlepší výsledek?
+
300 DPI v šedé škále je sladké místo. Pod 200 DPI znak tvary začínají rozpadat; nad 400 DPI získáte téměř nic a platit za něj ve velikosti souboru a zpracování času.
Můžu běžet OCR PDF na několika PDF documents najednou?
+
Ano?Nahrát soubor a oni se zpracovávají paralelně pod jedním souborem nastavení, což je bod, kdy se dokument pracovní postup zde, spíše než kliknutí přes stolní čtečku.
Přežívají záložky, odkazy a tvarová pole?
+
Výjimkou jsou mimořádky, interní odkazy a anotace. Digitální podpisy: každá změna souboru nutně zneplatňuje podpis, protože právě k tomu je podpis.
Stojí OCR PDF něco?
+
Ne. OCR PDF je zdarma bez účtu, a nic není orazítkován na stránky. Nahrané dokumenty jsou vymazány z pracovníků krátce po dokončení práce.
Existuje limit velikosti souboru na OCR PDF?
+
Ano: volné účty zpracovávají dokumenty až do 5 MB každý, který pokrývá většinu zpráv a smluv, ale ne dlouho skenované dokument na 600 DPI; Ghostscript a qpdf dělat práci. Skenované PDF jsou obvyklá věc, která ji přesahuje, a stlačování dokumentu první je obvykle dost na to, aby ho zpět pod.
Proč PNG místo hostitele OCR PDF?
+
PNG.to je postaveno kolem formátu, který používáte, když si nemůžete dovolit ztratit pixel: bezztrátový, alfa-schopný a správná odpověď na screenshoty, loga, linka umění a cokoli s tvrdými hranami. Práce s obrazem je jen zřídka jeden krok: lidé přicházejí změnit formát a nechat obraz potřebují jinou velikost, jinou váhu nebo jiný tvar. Během OCR PDF na stejném nahrávání potrubí, stejné velikosti čepice a stejný účet je celý důvod, proč je tady, spíše než na čtvrté záložce.
Co mám dělat s výsledkem, až bude OCR PDF hotovo?
+
Převodník na těchto stránkách přesune obrázky do a z PNG, JPG, WebP, GIF a SVG díry, což je krok, kde rozhodnutí o transparentnosti skutečně se dostane. To je krok, pro který si většina lidí skutečně přišla a dělala to po OCR PDF, a ne předtím, než to znamená, že konverze funguje ze souboru, který jste nakonec vyřešili.
Je tady OCR PDF stejný nástroj, který vedou sourozenecké stránky?
+
Motory jsou sdíleny stejné knihovny, stejné pracovníky, stejné limity. Co se liší je rada, a rady zde začíná od jedné skutečnosti o formátu této stránky je pojmenován po: neexistuje žádná kvalita posuvník, aby se špatně? PNG kolo-výlety bit-přesně, takže jediná věc edituje stojí vás je velikost souboru. PNG místo je názor na to, kde PNG je správné místo určení a kde není, a že úsudek je cennější než tlačítko.
Potřebuju účet a je něco udržované?
+
Žádný účet, a nic není uchováno: nahrávky jsou vymazány z pracovníků krátce po dokončení práce, a nic z toho, co zpracováváte, indexuje, uvádí nebo používá pro cokoli jiného. Volný účet existuje pro historii a velikost šarže, není pro přístup.