RedactDrop › 黒い四角を重ねただけでは黒塗りにならない理由
黒い四角を重ねただけでは黒塗りにならない理由
2026 年 9 月 30 日公開 · Tekiba
要点:PDF の文字の上に黒い四角を描くと、ページの上に図形が 1 つ加わるだけです。下の文字はファイルに残っているので、選択、コピー、検索ができ、文字を取り出すツールならどれでも読み出せます。黒塗り(墨消し)とは、文字をファイルから取り除き、そのうえで取り除いた場所に印をつけることです。
PDF のページの正体
PDF のページは 1 枚の絵ではありません。コンテンツストリームと呼ばれる描画命令の並びで、閲覧ソフトはそれを順に実行します。このフォントを使う、ここへ移動する、この文字を表示する、あちらへ移動する、この矩形を黒で塗る、という具合です(ISO 32000-1、7.8.2「Content Streams」、9.4.3「Text-Showing Operators」)。
描画ツール、黒に設定した蛍光ペン、編集ソフトの四角形などで黒く塗ると、この並びの最後に「矩形を塗る」という命令が 1 つ加わります。閲覧ソフトは先に文字を描き、その上に矩形を描くので、目には黒く見えます。しかし文字を表示する命令は文字ごとそこに残っていて、画素ではなく命令を読むものには、そのまま見つかります。
再現できる例
口座番号を含む、架空の短い手紙で試します(英語版の記事と同じ英文のサンプルです)。口座番号の上に黒い四角を描いただけで、ファイルにはほかに何もしていません。
これを、Xpdf の無料のコマンドライン文字抽出ツール pdftotext(ここではバージョン 4.06)にかけます。
$ pdftotext -layout letter-boxed.pdf - Harbour Lane Lettings 12 Sample Street, Exampletown EX1 2AB 26 September 2026 Dear Morgan Example, Thank you for your deposit. We have received it into the account below, and it is held for the length of your tenancy. Tenant: Morgan Example Deposit account: 0412 7788 3319 0000 Amount: 1,250.00 Please keep this letter with your tenancy agreement.
口座番号はそのまま出てきます。コマンドラインのツールがなくても見えます。多くの閲覧ソフトでは、黒い四角の上をドラッグしてコピーし、テキストエディターに貼り付ければ番号が出ますし、「0412」で文書内を検索すれば、黒の下で一致が強調表示されます。
語が隠れるほかの場所
見えている文字は入口にすぎません。PDF は、どのページにも表示されない部分にも同じ語を持てます。
- メタデータ。文書情報辞書と XMP メタデータには、タイトル、作成者、件名、キーワードが入ります。この手紙の作成者欄は「Morgan Example」です。閲覧ソフトの文書のプロパティで見られます。
- 置換テキスト。ActualText は、ページのある部分についてスクリーンリーダーや検索が使うべき文字を指定するもので、何でも書けます(ISO 32000-1、14.9.4「Replacement Text」)。
- コメント、フォームフィールド、しおり。その文字はページの描画命令の外にあります。
- 添付ファイル。PDF の中に丸ごと入ったファイルです。
- 以前の版。PDF は変更をファイルの末尾に追記して保存できるため、編集前の版が中に残っていることがあります。
黒塗り(墨消し)とは何か
PDF の仕様は、墨消しを 2 段階で説明しています。まず取り除く内容に印をつけ(そのための注釈が墨消し注釈です)、次に閲覧ソフトが印を適用すると、墨消し注釈が指定した範囲の内容が取り除かれ、その場所に何らかの印が表示されます(ISO 32000-1、12.5.6.23「Redaction Annotations」)。描いた矩形に欠けているのは、この「取り除く」段階です。
Adobe Acrobat Pro の墨消しツールもこの流れで、文字や範囲に印をつけてから墨消しを適用します。メタデータ、コメント、非表示のレイヤーなどの隠れた情報を取り除く手順は別にあり、Adobe はこれを「サニタイズ」と呼んでいます(Adobe: Redact sensitive content、Adobe: Sanitize PDFs)。やり方はツールごとに違っても、語がファイルから出ていかなければならないという考え方は同じです。
日本の情報公開の制度も、取り除くことを前提にしています。行政機関の保有する情報の公開に関する法律(情報公開法)第 6 条は、不開示情報が記録された部分を「容易に区分して除くことができるときは」、その部分を除いた部分を開示しなければならないと定めています(e-Gov 法令検索、制度の案内は総務省「情報公開制度」)。紙なら黒く塗ってコピーすれば済みますが、電子ファイルでは、見た目を塗ることと、その部分を「除く」ことは別の作業です。
RedactDrop が四角を描く代わりにすること
RedactDrop は、語を描く命令をページのコンテンツストリームから取り除き、その場所を黒く塗ります。次に、ページの描画に必要なものだけで PDF を作り直すため、メタデータ、置換テキスト、添付ファイル、以前の版は取り除かれ、コメント、フォームフィールド、しおりも、しおりやフォーム・コメントの見た目を残すことを選ばない限り取り除かれます。最後に新しいファイルを開き直して確認し、通らないページがあればファイルは出しません。
同じ抽出ツールで RedactDrop の出力を読むと、こうなります。
$ pdftotext -layout letter-redacted.pdf - Harbour Lane Lettings 12 Sample Street, Exampletown EX1 2AB 26 September 2026 Dear , Thank you for your deposit. We have received it into the account below, and it is held for the length of your tenancy. Tenant: Deposit account: Amount: 1,250.00 Please keep this letter with your tenancy agreement.
手紙のほかの部分は変わらず、選択もできます。消えたのは、取り除くよう指定したものだけです。
黒塗りした PDF を自分で確かめる方法
- 閲覧ソフトで、消した語と、その一部(番号の下 4 桁、姓だけなど)を検索します。日本語の書類なら、全角と半角の両方で試してください。
- 黒い部分をまたいで選択し、コピーして、テキストエディターに貼り付けます。
- 文書のプロパティで、タイトル、作成者、キーワードに手がかりが残っていないか見ます。
- 別の閲覧ソフトで開くか、pdftotext などの文字抽出ツールにかけます。
- すべてのページを自分の目で見ます。検査は、探すよう作られたものしか見つけられません。
覆うのではなく、語を取り除く。RedactDrop はブラウザーの中で動き、ダウンロードの前に結果を確認します。黒塗りのページを開く
よくある質問
黒い蛍光ペンで塗るのは黒塗りと同じですか?
同じではありません。蛍光ペンや塗りつぶした図形は文字の上に描かれるだけで、文字はファイルに残り、コピー、検索、抽出ができます。
PDF に印刷し直せば、隠れた文字は消えますか?
確実には消えません。PDF への印刷では文字が文字のまま残ることが多く、描いた四角の下の語が新しいファイルにそのまま入ることがあります。タイトルなどのメタデータが残ることもあります。
黒塗りが正しくできているか、どう見分けますか?
消した語で検索し、黒い部分をまたいでコピーしてテキストエディターに貼り付け、文書のプロパティを見て、別の閲覧ソフトや文字抽出ツールで開きます。
RedactDrop はスキャンした書類を黒塗りできますか?
画像の中の文字は読みません。OCR がないためです。スキャンしたページの一部に矩形を描けば、その下の画像の画素を置き換えます。