テキスト認識 (OCR)

PDFまたは画像ファイルを追加してください — またはここにドラッグ
PDF JPG PNG WEBP

このOCRテキスト認識ツールについて

光学文字認識は、文字が写った画像から文字を読み取ります。スキャンした契約書、撮影したレシート、エラーメッセージのスクリーンショットは文書のように見えますが、コンピューターが選択・検索・コピーできるテキストを含んでいません。OCRは文字の形を調べて文字を復元します。

このツールは長い歴史を持つオープンソースのOCRエンジンTesseractをWebAssemblyへコンパイルし、サーバーではなくブラウザ内で実行します。PDFのページは認識の前に元の2倍の大きさでレンダリングされます。解像度が精度を左右する最大の要因だからです。結果はページの区切り表示が入ったプレーンテキストファイルです。

認識がご自身の端末で実行されます。OCRサービスはたいていアップロードを要求するため、これは異例の方式であり、給与明細・診断書・身分証明書を送信せずに読み取れるということです。

OCRでテキストを抽出する手順

  1. PDFまたは画像を追加します。 スキャン、写真、スクリーンショットのいずれも使えます。PDFに加えJPG・PNG・WebP・HEICを受け付けます。
  2. 言語を選びます。 自動はページの言語と英語を併用し、混在文書によく適合します。純粋な英語文書なら英語に固定してください。
  3. 認識を開始します。 言語モデルは初回利用時にダウンロードされ以降キャッシュされます。1ページあたり数秒かかり、進捗カウンターが表示されます。
  4. テキストをダウンロードします。 結果はUTF-8の.txtファイルで、ページが番号付きの区切りで分けられています。

精度を左右する要因

要因結果への影響
元の解像度最も決定的。300 DPIのスキャンは安定し、100 DPIは推測に近い
傾き2度を超えると精度が急速に落ちる
コントラスト白地に黒が理想。薄い複写や色付きの背景は不利
書体一般的な明朝・ゴシックは安定。手書きは非対応
レイアウト単段はきれいに流れる。多段や表は構造が失われる

言語について

自動モードは現在のページの言語と英語を併用します。日本語の文書は日本語+英語、韓国語の文書は韓国語+英語として認識する、という具合です。ある言語で書かれた文書に英語の製品名、住所、技術用語が混ざるという現実的な状況に合わせた組み合わせです。

各言語モデルは数メガバイトの個別ダウンロードで、初回利用時に取得されブラウザがキャッシュします。そのため新しい言語の初回実行は2回目より明らかに時間がかかります。

よくある質問

OCRはサーバーで実行されますか。

いいえ、そこが要点です。TesseractがWebAssemblyへコンパイルされブラウザのタブ内で実行されます。スキャンがアップロードされないため、オンラインサービスへ渡したくない文書にも安全です。

精度はどのくらいですか。

きれいでまっすぐな300 DPIの活字スキャンなら、通常95%を大きく上回ります。薄い複写、傾いたページ、低解像度の写真、変わった書体はいずれも精度を明らかに下げます。

手書きも読めますか。

いいえ。Tesseractは活字で学習しています。手書きのメモ、署名、筆記体は認識されません。

出力の形式は何ですか。

UTF-8のプレーンテキストファイルです。ページは番号付きの区切りで分けられます。レイアウト、段組み、表、画像は保持されません。

初回実行がとても遅いのはなぜですか。

数メガバイトの言語モデルをダウンロードする必要があるためです。以降はキャッシュされるので、同じ言語の次の文書はすぐ開始されます。

検索可能なPDFが作られますか。

いいえ。結果はPDFにテキストレイヤーを戻すのではなく別のテキストファイルです。検索、引用、他システムへの取り込みにお使いください。

関連ツール