PDFの墨消しとデータ除去:PolyPDFの制限
要点
PolyPDF の機密 PDF コンテンツの削除では、マークされたトークンが通常の検索可能なテキストである場合にそのトークンが削除されますが、その動作はすべての PDF 構造に一般化されるわけではありません。再利用可能なフォーム コンテンツ内にネストされたアウトライン文字、ベクター アートワーク、画像は黒い塗りつぶしの下に残る可能性があるため、黒い領域がチェックされることはありません。ファイルを保存し、再度開き、テキストを再度検索して抽出します。ドキュメントの非表示データをクリーンアップすると、メタデータ、ページのサムネイル、添付ファイル、および JavaScript アクションに対して個別の選択肢が提供されます。保存すると、新しい PolyPDF /Producer および /ModDate エントリが書き込まれ、ページに直接配置された添付ファイルは存続します。機密性が完全な削除に依存する場合は、承認された専門家のワークフローを使用してください。
黒い四角形は機密性の高い PDF コンテンツの削除ではなく、隠し PDF データのクリーンアップ パスが完了しても、すべての隠しオブジェクトが見つかったわけではありません。 PolyPDF は、マークされた領域の下にある通常の検索可能なテキストを削除し、選択した構造をクリアしますが、機密リリースでは、PDF 内の実際のコンテンツと一致するチェックが依然として必要です。
- リリースレビュー
- PolyPDF 1.5.1 (ビルド 23) に準拠 。以前のウォークスルーとスクリーンショットは、以下のバージョンのままです。
- ウォークスルー検証済み
- テスト済み
- PolyPDF 1.5.0 (ビルド 22)。 1.4.0 (ビルド 17) のスクリーンショット
- プラットフォーム
- macOS と Windows
機密 PDF コンテンツの削除とドキュメントからの非表示データのクリーンアップがそれぞれどのような処理を行うか
機密 PDF コンテンツの削除とドキュメントからの非表示データのクリーンアップは、PDF のさまざまな部分で機能しますが、どちらも万能のスクラバーではありません。機密 PDF コンテンツを削除すると、マークされた領域と交差する検索可能なテキスト演算子が書き換えられます。削除するサポートされているテキストがない場合でも、PolyPDF は黒い塗りつぶしを描画して操作を完了するため、ベクター アウトライン、パスに変換されたテキスト、およびその他のグラフィックスはその下のファイルに残ることができます。
PolyPDF がテキストが削除されていないと報告した場合、ページが黒く見えても機密性の高い PDF コンテンツは何も削除されていません。そこで停止して、その素材を承認されたコンテンツ削除ワークフローに移動します。
| 内容または構造 | 何が起こるか | 何をすべきか |
|---|---|---|
| 検索可能なテキスト | マークされた領域が text-show 操作にマップされる場合は削除されます | 保存したコピーを再度開き、検索して抽出して確認します |
| アウトラインまたはベクトル文字 | コマンドが完了する間、黒い塗りつぶしの下に留まることができます | 黒い部分を除去として扱わないでください |
| ラスター画像とネストされた画像 | 最上位の配置が検出されます。フォームコンテンツにネストされた画像は使用できません | 画像対応ワークフローを使用して出力を検査する |
| メタデータとカタログ構造 | 選択したカテゴリをターゲットとするドキュメントの非表示データを消去します | 完全なスイープを想定するのではなく、保存されたファイルを検査する |
| 添付ファイルとアクション | ページに直接配置された添付ファイルはパスを通過しても存続します | 構造検査または専門の隠し PDF データ クリーンアップ プロセスを使用する |
PolyPDF は、安全に書き換えることができないページ (再利用可能な Form XObject を通じてテキストを描画するページなど) を拒否します。拒否は回避策の失敗ではありません。これは、ページに別のツールが必要であることを意味します。
サポートされている検索可能なテキストの保守的なワークフロー
- ソース PDF を複製し、作業プロセスが上書きできない場所にオリジナルを保持します。
- 対象が通常の検索可能なテキストであることを、検索して選択して確認します。スキャン、イメージ、アウトライン、またはベクター パスの場合、このワークフローでは削除されません。
- [機密コンテンツを削除] ツールを選択し、サポートされている各テキスト項目の周囲に狭い領域を描画します。何かを適用する前に、重複する名前、ヘッダー、フッター、および同様のページを確認してください。
- 機密性の高い PDF コンテンツの削除を適用し、結果を読み取ります。拒否、エラー、または「テキストは削除されません」という結果は、ファイルから何も出力されなかったことを意味します。黒い外観に依存しないでください。
- 新しい候補ファイル名で保存し、閉じて、保存したファイルを再度開きます。
- 保存されたファイル全体からテキストを検索して抽出します。以前の領域を選択してコピーし、2 番目の受信者スタイルのビューアで検査してみてください。
- 機密コンテンツ、規制対象コンテンツ、特権コンテンツ、または法的に機密性の高いコンテンツの場合は、これらのチェックに合格した場合でも、組織が承認した機密 PDF コンテンツの削除および検査プロセスに従ってください。
このようなトークンの場合、保存されたファイルは、アプリ内検索、テキスト抽出、非圧縮ファイルのバイト検索というレビュー担当者が実行できる 3 つのチェックすべてで空になります。これらのチェックはテキストをカバーし、それ以外は何もカバーしません。 1 つのシートにテキスト演算子、ラスター ピクセル、ベクター レタリング、クリッピング パス、再利用可能なフォーム コンテンツを混在させることができ、このページの画像はそのまま残されました。
画像、アウトライン、ネストされたグラフィックスを別の問題として扱う
PolyPDF は機密 PDF コンテンツの削除を適用する前にトップレベルの画像配置を検出しますが、そのチェックはすべてのネストされた Form XObject に対して再帰されるわけではないため、再利用可能なフォーム コンテンツ内に埋め込まれた画像がそれをすり抜ける可能性があります。アウトラインに変換されたテキストは、テキスト表示操作ではなくベクター アートワークであり、同様に塗りつぶしの下に残る可能性があります。
- 外観からコンテンツの種類を推測しないでください。文字列を検索できるということは、それがテキストであることがわかります。ページの残りの部分については何もわかりません。
- ページのフラット化、ラスタライズ、印刷、またはカバーを行わず、そのステップだけでセキュリティまたは記録の要件が満たされると想定してください。
- スキャンされたページまたは画像ベースの識別子の場合は、承認された画像対応の機密 PDF コンテンツ削除ツールを使用し、結果のピクセルと PDF 構造を確認します。
- アウトラインまたはベクター レタリングの場合は、不透明な形状を追加するのではなく、基礎となる描画コマンドを削除または置換するプロセスが必要です。
- 最終ファイルを独自に検査できない場合は、PolyPDF の結果のみに基づいて機密資料を公開しないでください。
2 番目のビューアは視覚的な相互運用性に役立ちますが、フォレンジック検査ツールではありません。機密リリースには、テキストの抽出、オブジェクトの検査、および承認されたレビュー記録が必要な場合があります。
Document のクリーンな非表示データをスコープ付きクリーンアップ パスとして使用する
「ドキュメントからの非表示データの削除」では、ドキュメントのメタデータと XMP パケット、ページのサムネイル、添付ファイル、JavaScript とアクション、およびオプションのフォームまたは署名フィールドの削除について個別の選択肢が提供されます。これらのラベルは、パスのターゲットを説明します。これらは、PDF オブジェクト グラフ内のすべての場所が訪問されることを保証するものではありません。
- 既存のドキュメントのメタデータはクリアされますが、保存すると新しい PolyPDF /Producer および /ModDate エントリが書き込まれます。結果としてメタデータのないファイルが作成されることはありません。
- カタログの JavaScript 名ツリーが削除されました。注釈、フォーム フィールド、アウトライン、またはネストされたチェーンを介して到達したアクションがそれに伴うことは保証されません。
- 添付ファイルのクリーンアップは完全ではありません。添付ファイルのクリーンアップが選択されている場合、直接の FileAttachment アノテーションとその埋め込みペイロードは、バイト単位のパスを通過しても残ります。
- ページのテキストと画像は、トップレベルの画像とフォーム XObject にネストされた画像も同様に、そのままの場所に残ります。ドキュメントからの非表示データの削除は、機密性の高い PDF コンテンツの削除手順ではありません。
- フォームと署名フィールドの削除は破壊的であり、デフォルトではオフになっています。これらのフィールドを失うつもりがある場合にのみ、これをオンにします。
- 部分的なクリーンアップによってレコードのコピーが置き換えられないように、変更されていないソースを保持し、各候補出力を個別の名前で保存します。
結果メッセージでは、何が残っているかではなく、パスによって削除されたものがカウントされます。ダイアログのラベルや完了メッセージではなく、検査した保存ファイルに基づいてリリースを決定します。
完了メッセージではなく、保存されたバイトを確認してください
すべてのチェックがメモリ内のビューではなく保存されたバイトに基づいて行われるように、正確な候補ファイルを閉じて再度開きます。完全なレビューでは、レンダリングされたページ、検索可能なテキスト、ドキュメントのプロパティ、埋め込みファイル構造、注釈、フォーム フィールド、ブックマーク、リンク、アクションなど、複数の面を通じて情報を追跡します。
- 完全な機密値と有用なフラグメントを検索し、すべてのページに対して独立したテキスト抽出を実行します。
- 受信者がこれらのパスを使用する場合は、出力を印刷またはエクスポートするなど、高ズームおよび 2 番目の PDF ビューアで検査します。
- 承認された構造検査ツールを使用して、埋め込みファイルのインベントリを作成し、注釈、フォーム、アウトライン、および追加アクションのエントリを検査します。
- ページ数、ブックマーク、リンク、フォーム、署名、レイヤー、印刷の外観がリリース要件を満たしていることを確認します。
- 入力ファイル名またはハッシュ、出力ファイル名、レビュー担当者、日付、ツールのバージョン、およびプロセスで監査証跡が必要な場合に実行されたチェックを記録します。
効果的な例: 捨ててもよいファイルでリハーサルを行う
実際のファイルに触れる前に、そのファイルに似た使い捨て PDF を作成します。つまり、通常の検索可能なテキストとして 1 つの識別子、ラスター イメージ、そして (実際の図面にそれらがある場合は) 再利用可能な Form XObject を通じて描画されたテキストが含まれます。識別子から機密コンテンツを削除し、PolyPDF がどの部分を処理し、どの部分を拒否するかを監視します。テキストが Form XObject からのものであるページは、機密性の高い PDF コンテンツが半分削除されるのではなく、完全に拒否されます。これは、締め切り中ではなく締め切り前に確認したい動作です。
リージョンを適用し、新しい名前で保存し、ファイルを閉じて、そのファイルを再度開きます。識別子を検索し、すべてのページのテキストを抽出し、カウントがゼロに戻ることを確認します。そうでない場合、または機密コンテンツが画像、アウトライン、またはベクター パスである場合、そのコンテンツには別のツールが必要です。
同じ方法で、非表示の PDF データのクリーンアップをリハーサルします。ドキュメントのメタデータ、JavaScript エントリ、添付ファイル、画像を含むコピーから開始します。ドキュメントからクリーンな非表示データを実行します。次に、保存されたファイルを調べます。 JavaScript エントリと元のメタデータは失われ、保存時に新しいProducer メタデータと ModDate メタデータが書き込まれ、添付ファイルと両方のイメージがまだ存在することが予想されます。
リハーサルでは、PolyPDF が特定の種類の図面に対してどのように動作するかを説明します。これは、PolyPDF を機密 PDF コンテンツの削除または機密文書の非表示 PDF データ クリーンアップ コントロールのみにする理由にはなりません。
よくある質問
ブラック ボックスを描画すると、PDF から機密コンテンツが永久に削除されますか?
いいえ。不透明な外観では、検索可能なテキスト、ベクター パス、白抜き文字、または画像ピクセルがファイル内に残る可能性があります。サポートされているテキストが実際に削除されたことを確認し、コンテンツに適した検査プロセスを使用します。
PolyPDF は、スキャンされたページ画像内のテキストから機密コンテンツを削除できますか?
いいえ。PolyPDF は一部のトップレベル画像の重複を検出しますが、フォーム コンテンツ内にネストされた画像はそのチェックをすり抜けてしまう可能性があり、機密性の高い PDF コンテンツの削除ではピクセルは削除されません。スキャンされたページには、承認された画像対応ワークフローを使用します。
ドキュメントの非表示データをクリーンアップすると、すべての添付ファイルとスクリプトが削除されますか?
いいえ。カタログの JavaScript 名ツリーは削除されますが、ページに直接配置された添付ファイルはペイロードが変更されずに存続し、注釈、フォーム フィールド、アウトライン、またはネストされた構造を介して到達されるアクションがそれに付随することは保証されません。保存された PDF の構造を検査します。
デジタル署名された PDF から機密コンテンツを削除する必要がありますか?
ページのコンテンツを変更すると、署名が無効になったり、ファイルによってブロックされたりする可能性があります。承認された未署名のソースを入手し、承認された削除ワークフローを完了し、新しい問題を確認し、コンテンツの変更が完了した後にのみ署名します。
出典と詳細情報
- NIST SP 800-122: 個人を特定できる情報の機密性を保護するためのガイド
- PolyPDF 1.5.0 の機密 PDF コンテンツの削除と非表示の PDF データのクリーンアップ動作 — 機密性の高い PDF コンテンツの削除では、マークされた領域の下にある通常の検索可能なテキストが削除されます。 Form XObject を介してテキストを描画するページは、機密性の高い PDF コンテンツが部分的に削除されるのではなく、拒否されます。 「ドキュメントから非表示データを消去」は、選択したカテゴリを消去しますが、ファイル内のすべての構造を走査するわけではありません。
捨ててもよいファイルでリハーサルをする
macOS または Windows 用の PolyPDF をダウンロードし、テキストに依存する PDF コンテンツの削除を実行し、最初に使い捨てコピー上のドキュメントから隠しデータを消去します。機密性が完全な削除に依存する場合、これを唯一のリリース制御にしないでください。
試用タイマーなしで無料: 注釈、レビュー、キャリブレーション、ドキュメントごとに 3 つの手動作成測定、およびリビジョン パッケージの表示。シンボル検索、プラグイン、リビジョン パッケージの変更または公開には Pro が必要です。






