Fuseji伏字 ダウンロード

スキャンした PDF の黒塗りで文字が残る理由と、渡す前の確かめ方

先に結論

「スキャンした PDF は画像だから、上から黒く塗れば消える」と考えがちです。ところが、スキャンした PDF でも、黒く塗った部分の文字が読めてしまうことがあります。原因は大きく 2 つです。

  • 見えない文字の層が残る:スキャナーや PDF のソフトが文字認識(OCR)をかけると、ページの画像の上に、目に見えない文字の層が付くことがあります。画像の上で黒く塗っても、この層の文字はファイルの中に残り、選んでコピーしたり検索したりすると出てきます。
  • 塗りが透ける・塗り残す:文字の層の無い、画像だけの PDF でも、塗りが薄かったり、端が塗り残されていたりすると、下の文字が透けて見えます。

どちらの失敗も、仕組みを知って渡す前に確かめれば、防ぎやすくなります。このページでは、2 つの原因の仕組み、手元の PDF がどちらの種類かの見分け方、安全に黒塗りする手順の順で説明します。黒塗りの失敗の全体像(黒い四角を重ねただけ・文書情報・編集前の版など)は 黒塗りが「見える」「剥がせる」原因と、渡す前の確かめ方 にまとめています。ここではスキャンした PDF に絞ります。

スキャンした PDF には 2 種類ある

画像だけの PDF

紙をスキャンしただけの PDF は、ページの中身が 1 枚の画像です。画面では文字が読めても、ファイルの中に「文字」としての情報はありません。文字を選ぼうとしても選べず、検索しても何も見つかりません。

画像に、見えない文字の層が付いた PDF

もう 1 つは、スキャンした画像に、文字認識で読み取った文字を重ねた PDF です。国立国会図書館は、「学術文献のテキストデータの製作」のページで、この形式(透明テキスト付 PDF)を次のように説明しています。

「PDFファイルの一種で、紙資料をスキャンしたデジタル化画像と、テキストデータを1つのファイルとしてまとめたファイル形式です。テキストは透明であるため、目に見えませんが読み上げることが可能です。」

見た目は画像だけの PDF と変わりません。けれども、ファイルの中には文字が入っていて、文字を選んだり、検索したり、読み上げたりできます。検索できて便利なので、スキャナーや複合機、PDF のソフトの設定によっては、スキャンと同時に文字認識をかけて、この形式で保存することがあります。どの設定でそうなるかは機器やソフトによって違うので、お使いの機器やソフトの説明を確かめてください。

問題は、受け取った人も、作った本人も、見た目だけではどちらの種類か分からないことです。自分では「画像だけ」のつもりで黒く塗った PDF が、実は文字の層付きだった、ということが起こり得ます。

文字の層がある PDF で黒く塗ると

画像を塗っても、文字の層は残る

文字の層がある PDF で、黒い四角の図形や注釈を重ねたり、画像の上を黒く塗ったりしても、塗られるのは見た目の画像のほうです。その上に重なっている透明な文字の層は、別の情報としてファイルの中に残ります。

その結果、次のようなことが起こります。

  • ページ全体を選んでコピーし、ほかのアプリに貼り付けると、黒く塗った部分の氏名や番号が文字として出てくる
  • PDF の検索で、塗ったはずの氏名を探すと見つかる
  • 読み上げの機能で読ませると、塗った部分も読み上げられる

画面では真っ黒に見えているので、作った本人は気づきにくい失敗です。

黒い四角が注釈なら、外すと画像の文字も見える

黒い四角が注釈として重なっているだけなら、注釈を消したり動かしたりすると、下の画像の文字もそのまま見えてしまいます。これは文字の層の有る無しにかかわらず起きます。スキャンした PDF でも、「黒い四角を重ねただけ」の黒塗りは、文字の PDF と同じように剥がせます。

検索で見つからなくても安心できない

文字認識は、かすれた文字や手書きの文字などを読み違えることがあります。文字の層の中では、名前が 1 字違って入っていたり、途中で区切れていたりすることもあります。そのため、消した名前で検索して見つからなかったとしても、文字の層に何も残っていないとは言い切れません。確かめるときは、検索だけでなく、ページ全体を選んでコピーし、出てきた文字を読んで確かめるのが確実です。

画像だけの PDF で起きること

塗りが薄いと透ける

文字の層の無い、画像だけの PDF なら、ファイルの中に文字の情報がないので、コピーや検索で文字が抜き出される心配はありません。危ないのは、見た目そのものです。

  • 紙にペンで塗ってからスキャンしたとき、インクが薄いと、塗りの下の文字が透けて読めることがある
  • 塗りが文字より小さく、文字の端や一部がはみ出している
  • 画像の上から黒く塗ったつもりが、色が濃い灰色で、下の文字がうっすら見える

紙の黒塗りが透けることについては、裁判所の案内にも書かれています。さいたま家庭裁判所の「相手に知られたくない情報がある場合について」は、黒塗り(マスキング)の具体的な方法として、原本をコピーし、コピーを黒塗りするよう案内したうえで、次のように書いています。

「黒塗り(マスキング)しても該当部分が透けて見える場合には、黒塗り(マスキング)した書面を更にコピーして、該当部分が透けて見えていないか十分に確認する。」

原本ではなく、写しに塗る

同じ案内は、原本を黒ペン等で黒塗りしないよう書いています。厚生労働省の行政文書の開示請求についての審査基準も、文書の一部を除く方法として、「コピー機で作成したその複写物に墨を塗り再複写する等して行うことができ」と書いています。原本はそのまま残し、写しを塗って、それをもう一度写す、という手順です。

スキャンして PDF にする場合も考え方は同じです。塗った写しをスキャンしたら、その PDF を画面で拡大して、塗った部分が透けていないか、塗り残しがないかを確かめます。

手元の PDF がどちらかを見分ける

文字を選べるか、検索できるか

手元のスキャンした PDF に文字の層があるかどうかは、次の方法で見当が付きます。

  1. 文字を選んでみる:PDF を開いて、本文の上をドラッグしてみます。文字の形に沿って選べるなら、文字の層があります。ページ全体が 1 つの画像として選ばれる、または何も選べないなら、画像だけの可能性が高いです。ただし、画像の中の文字をその場で読み取って選べるようにする機能を持つアプリもあるので、選べたからといって文字の層があるとは限りません。
  2. 検索してみる:ページに見えている語を検索してみます。見つかるなら、文字の層があります。
  3. 全部を選んでコピーする:ページ全体を選んでコピーし、メモ帳などに貼り付けます。黒く塗った部分の文字が出てこないかを確かめます。

文字の層があると分かったら、上の節のとおり、黒く塗った部分の文字が層に残っていないかを必ず確かめます。画像だけだと分かったら、透けと塗り残しを目で確かめます。

道具で調べる

手で確かめるのが難しいときは、道具を使う方法もあります。

  • ブラウザで剥がしテスト(無料)は、PDF をブラウザの中だけで調べ、黒い四角の下の文字や見えない文字、注釈、文書情報などを見つけます。ファイルはどこにも送りません。ただし、画像(スキャン)の中の文字は調べていません。ページが画像になっている部分は、黒塗りが薄くて下の文字が透けていないかを、目で確かめてください。
  • Fuseji アプリの 剥がしテスト(無料)は、スキャンされた画像だけの PDF でも、Mac の文字認識で読み取って調べた上で結果を返します。スキャンした書類が多いときは、こちらが向いています。

どの道具で調べても、何も見つからなかったことは「調べた範囲に残っていなかった」という意味です。何を消すべきか、消し忘れが無いかの最終的な確認は、渡す方ご自身で行ってください。

スキャンした書類を安全に黒塗りする手順

紙の段階で塗る

特許庁は、営業秘密の箇所に墨塗処理をした PDF ファイルの作成方法の 1 つとして「スキャナを用いた方法」を挙げ、「営業秘密の箇所が塗りつぶされた証拠の写し等の印刷物を用意し、当該印刷物をスキャナでPDF化します。」と書いています。紙の段階で塗ってからスキャンする方法です。

この方法では、塗った部分の文字は、スキャンした画像にはもう写っていません。その画像に文字認識をかけても、塗りがしっかりしていれば、ふつうはその部分の文字は読み取られません。ただし、塗りが薄くて透けていると、透けた文字を文字認識が読み取ってしまうことがあります。塗りの濃さは、スキャンする前とスキャンした後の両方で確かめます。

同じ資料は、作ってはいけない方法として、文字色と同色のハイライトや蛍光ペン、マーカー等のアプリの機能を使った方法で、「表示上塗りつぶしたとしても、文字情報が削除されず、データ上、文字のコピーが可能な方法」を挙げています。スキャンした PDF でも、文字の層があれば同じことが起きます。

スキャンした後の PDF で消すなら、下の文字ごと消す

すでにスキャンして PDF になっている書類を消すときは、下の文字ごと消す(焼き込み)方式を使います。見た目の画像と、その上の文字の層の両方から、消したい部分を取り除く方式です。専用の墨消し機能のあるソフトを使うときは、画像も対象になるか、見えない情報も合わせて削除されるかを、お使いのソフトの説明で確かめてください。黒い四角を図形や注釈で重ねるだけの方法は、上の節のとおり、文字の層も画像も残ります。

手順のまとめ

  1. 原本は残す:原本には手を加えず、写しやコピーを作ってから消す
  2. 消す範囲を決める:氏名・住所・電話番号・番号類など、渡す相手に見せない部分を洗い出す
  3. 紙で塗るなら:写しを濃く塗り、透けていないかを確かめてからスキャンする
  4. PDF で消すなら:黒い四角を重ねるのではなく、下の文字ごと消す方式を使う
  5. 文字の層を確かめる:ページ全体を選んでコピーし、消した語が出てこないかを確かめる
  6. 見た目を確かめる:画面で拡大して、透けや塗り残しがないかを確かめる

うまく消せていないと分かったら、その PDF の上から塗り直さず、消す前の写しや元のファイルに戻ってやり直します。塗り直しても、文字の層や下の画像は残ったままです。

Fuseji の使いどころ

Fuseji(伏字)は、日本語の PDF と画像から、氏名・住所・電話番号などの個人情報を候補として示し、選んだ部分を下の文字ごと焼き込むアプリです。スキャンした書類では、次の点が役に立ちます。

  • 文字の無いスキャン PDF も読む:テキストのない PDF は、Mac の文字認識で日本語を読み取ってから候補を探します
  • 文字の層が見た目と合わない PDF も読む:見た目の日本語が文字として取り出せない PDF は、画像として読み直します
  • 書き出すときの文字の層を選べる:「あり」(消した語を除いた文字を検索用に残す)と「なし」(全ページを画像にする)から選べます。提出先で文字を検索してもらう必要がなければ、「なし」がいちばん安全です
  • 書き出した後に確かめる:書き出した直後に、消した語が残っていないかを自動で確かめます

検出は「候補の提示」です。漏れがないことを保証するものではないので、最終的な確認は画面で行ってください。剥がしテストと自動検出は無料版でもずっと使えます(無料版の書き出しには透かしが入ります)。ダウンロード から試せます。価格は 価格 にあります。

このページは、スキャンした PDF の黒塗りで起きやすい失敗と確かめ方を一般論として整理したものです。スキャナーや PDF のソフトの機能・設定は機種や版によって違うので、お使いの機器やソフトの説明を確かめてください。どの情報を消すべきかの判断に迷うときは、個人情報保護委員会のガイドラインや専門家に確認してください。

参考