光学文字認識は、文字が写った画像から文字を読み取ります。スキャンした契約書、撮影したレシート、エラーメッセージのスクリーンショットは文書のように見えますが、コンピューターが選択・検索・コピーできるテキストを含んでいません。OCRは文字の形を調べて文字を復元します。
このツールは長い歴史を持つオープンソースのOCRエンジンTesseractをWebAssemblyへコンパイルし、サーバーではなくブラウザ内で実行します。PDFのページは認識の前に元の2倍の大きさでレンダリングされます。解像度が精度を左右する最大の要因だからです。結果はページの区切り表示が入ったプレーンテキストファイルです。
認識がご自身の端末で実行されます。OCRサービスはたいていアップロードを要求するため、これは異例の方式であり、給与明細・診断書・身分証明書を送信せずに読み取れるということです。
.txtファイルで、ページが番号付きの区切りで分けられています。| 要因 | 結果への影響 |
|---|---|
| 元の解像度 | 最も決定的。300 DPIのスキャンは安定し、100 DPIは推測に近い |
| 傾き | 2度を超えると精度が急速に落ちる |
| コントラスト | 白地に黒が理想。薄い複写や色付きの背景は不利 |
| 書体 | 一般的な明朝・ゴシックは安定。手書きは非対応 |
| レイアウト | 単段はきれいに流れる。多段や表は構造が失われる |
自動モードは現在のページの言語と英語を併用します。日本語の文書は日本語+英語、韓国語の文書は韓国語+英語として認識する、という具合です。ある言語で書かれた文書に英語の製品名、住所、技術用語が混ざるという現実的な状況に合わせた組み合わせです。
各言語モデルは数メガバイトの個別ダウンロードで、初回利用時に取得されブラウザがキャッシュします。そのため新しい言語の初回実行は2回目より明らかに時間がかかります。
いいえ、そこが要点です。TesseractがWebAssemblyへコンパイルされブラウザのタブ内で実行されます。スキャンがアップロードされないため、オンラインサービスへ渡したくない文書にも安全です。
きれいでまっすぐな300 DPIの活字スキャンなら、通常95%を大きく上回ります。薄い複写、傾いたページ、低解像度の写真、変わった書体はいずれも精度を明らかに下げます。
いいえ。Tesseractは活字で学習しています。手書きのメモ、署名、筆記体は認識されません。
UTF-8のプレーンテキストファイルです。ページは番号付きの区切りで分けられます。レイアウト、段組み、表、画像は保持されません。
数メガバイトの言語モデルをダウンロードする必要があるためです。以降はキャッシュされるので、同じ言語の次の文書はすぐ開始されます。
いいえ。結果はPDFにテキストレイヤーを戻すのではなく別のテキストファイルです。検索、引用、他システムへの取り込みにお使いください。