Comparison

日本語 PII 検出 API の比較PII-Fi / Microsoft Presidio / Azure AI Language PII / Google Sensitive Data Protection / Amazon Comprehend PII

日本語のテキストから個人情報(PII)を検出してマスキングする API を選ぶとき、最初に確かめるべきは「日本語に対応しているか」と「日本固有のエンティティ(マイナンバー・住所・電話番号・氏名)をどう扱うか」です。このページでは、よく候補に挙がる 5 つのサービスを、日本語対応の有無と方式、日本固有エンティティ、提供形態、料金モデル、データの保存と学習利用、導入のしやすさの 6 軸で並べます。他社の事実は各社の公式ドキュメントに書かれている範囲だけを転記し、出典を末尾に載せました。

2026/09/08 時点・各社公式ドキュメントより(当社調べ)

結論を先に言うと、日本語では「対応の有無」より「方式」で差がつく

5 つのうち、日本語テキストへの対応を公式に明記しているのは Azure AI Language PII と PII-Fi の 2 つです。Amazon Comprehend の PII 検出は英語とスペイン語のみで、Google Sensitive Data Protection は日本固有の infoType(マイナンバーなど)を持つものの、日本語テキスト全般への対応をリファレンス上で言語別に明記していません。Microsoft Presidio は既定が英語で、日本語で使うには NLP エンジンと認識器を自分で組み立てる必要があります。

日本語の個人情報は、番号(マイナンバー・免許証番号)よりも、氏名・住所・電話番号のような「形が揺れるもの」で差がつきます。多言語対応の汎用 API は番号系のパターンを持っていても、敬称つきの氏名や丁目・番地の表記ゆれをどこまで拾うかは公式ドキュメントに書かれていないため、実データで試すまで分かりません。

PII-Fi は、この「形が揺れるもの」を日本語専用に設計した検出エンジン(パターン・辞書・形態素解析・文脈解析・機械学習 NER の合議)で扱うことを前提に作られています。逆に、英語圏のデータが中心で日本語は一部、という場合は、多言語をひとつの API でまかなえる Azure や Google のほうが運用は楽です。どちらが向くかは、後半の「どう選ぶか」で整理します。

6 軸の比較表

比較軸 PII-Fi株式会社Qualiteg Microsoft PresidioOSS(MIT ライセンス) Azure AI Language PIIMicrosoft Azure Google Sensitive Data ProtectionGoogle Cloud(旧 Cloud DLP) Amazon Comprehend PIIAWS
日本語対応と方式 対応(日本語特化)
パターン・辞書(人名・地名・組織名など)・形態素解析・文脈解析・機械学習 NER の 5 経路の合議で判定。敬称・役職を氏名検出の手がかりに使う
明記なし
既定の構成は英語の認識器とモデル。他言語は NLP エンジンを別言語向けに設定したうえで、言語ごとの認識器・文脈語を追加する必要がある。公式の言語ページに日本語の記載はない
対応(ja)
テキスト PII の対応言語表に日本語(ja)が含まれる。会話 PII は英・仏・独・西のみ。方式は自然言語処理(NLP)によるエンティティ検出
言語別の明記なし
infoType リファレンスに日本固有の infoType はあるが、PERSON_NAME や STREET_ADDRESS などの汎用 infoType について日本語テキストへの対応を言語別に記載していない
非対応
PII 検出の対応言語は英語とスペイン語のみと公式に明記
日本固有エンティティ 公的番号 10 型(マイナンバー・旅券番号・運転免許証番号・在留カード番号・住民票コード・各種保険番号・基礎年金番号・法人番号・車両ナンバープレート・車台番号)に加え、氏名(敬称・役職・姓名辞書・NER)、住所(構造パターン+地名・住所辞書 約 40 万語)、電話番号(携帯・固定・0120・0570・050・+81・全角・内線など 11 パターン)を日本語向けに実装 なし
国別エンティティは US / UK / ES / IT / PL / SG / AU / IN / FI / KR / NG / PH / CA / SE / ZA / TH / TR / DE。日本向けは公式一覧に含まれない
8 種
JPBankAccountNumber、JPDriversLicenseNumber、JPMyNumberPersonal、JPMyNumberCorporate、JPPassportNumber、JPResidenceCardNumber、JPResidentRegistrationNumber、JPSocialInsuranceNumber。氏名・住所・電話番号は汎用の Person / Address / PhoneNumber
5 種
JAPAN_INDIVIDUAL_NUMBER(マイナンバー)、JAPAN_BANK_ACCOUNT、JAPAN_DRIVERS_LICENSE_NUMBER、JAPAN_PASSPORT、JAPAN_CORPORATE_NUMBER。氏名・住所・電話番号は汎用の PERSON_NAME / STREET_ADDRESS / PHONE_NUMBER
なし
国別エンティティはカナダ・インド・英国・米国のみ
提供形態 SaaS(Web アプリ「PII-Fi Scan」と HTTP API「PII-FI API v2」)。社内ネットワーク内で完結するオンプレミス構成を個別提案 OSS(Python ライブラリ・コンテナ)を自前でホスト クラウド API(Azure) クラウド API(Google Cloud) クラウド API(AWS)
料金モデル 月額の定額+ユニット制(1 ユニット = 10 万文字、検出・仮名化込み)。Personal Lite 19,800 円/月(100 ユニット)、Personal Standard 49,800 円/月(500 ユニット)、Personal Pro 98,000 円/月(2,000 ユニット)。初回契約はカード登録後 14 日間無料 ソフトウェアは無料。計算資源・運用・日本語対応の開発は自前 従量課金(1,000 テキストレコード単位)。無料枠は月 5,000 テキストレコード(Language の他機能と共有)。単価は Azure の料金ページ・料金計算ツールで確認 従量課金(検査・変換したバイト数)。content メソッドの検査は月 1 GB まで無料、1 GB 超は US$3.00/GB、1 TB 超は US$2.00/GB。変換は月 1 GB まで無料、1 GB 超は US$2.00/GB、1 TB 超は US$1.00/GB。1 要求あたり最小 1 KB を課金 従量課金(1 ユニット = 100 文字、1 要求あたり最小 3 ユニット)。Detect PII は US$0.0001/ユニット、Contains PII は US$0.000002/ユニット。無料枠は最初の 12 か月間、月 5 万ユニット
データの保存・学習利用 作業データはジョブ別の鍵で暗号化して一時保存し、通常 60 分・明示保存でも 48 時間で自動削除。API の同期処理では入力本文・検出値・mapping・変換結果を通常の記録へ残さない。復元素材は成果物に含めない。学習利用の扱いは利用規約を参照 自前ホストのため、データは自社環境の外へ出ない(保存・学習利用の方針は自社で決める) 送信データは最大 48 時間だけ一時保存して消去。PII エンドポイントは LoggingOptOut が既定で true。デプロイしたリージョンの外で顧客データを保存・処理しない。学習利用については当該ページに明記なし 製品概要・FAQ で保存・学習利用の明記を確認できず(Google Cloud 共通の利用規約に従う) AWS の AI サービスは「サービス改善(モデル学習を含む)のためにお客様のコンテンツを使用・保存することがある」と明記。AWS Organizations の AI サービス オプトアウト ポリシーで除外でき、Comprehend は対象サービスに含まれる
導入のしやすさ ブラウザだけで使える Web アプリと、API キーを発行して curl 1 本で試せる API。Bearer 認証・JSON。クイックスタートあり。契約は商談経由 Python 環境またはコンテナを自前で構築。日本語で使うには NLP モデルの選定・認識器の実装・評価が必要で、エンジニアリング工数が最も大きい Azure サブスクリプションと Language リソースを作成し、REST / SDK から呼び出す。多言語をひとつの API で扱える Google Cloud プロジェクトと IAM を用意し、content.inspect / content.deidentify を呼び出す。infoType を要求ごとに指定する AWS アカウントと IAM を用意し、SDK / CLI から呼び出す。日本語テキストには使えない

※ 2026/09/08 時点・各社公式ドキュメントより。他社の記載は当社が公式ドキュメントを読んで転記したもので、各社の公式見解ではありません。料金は税別・米ドル表記のものはそのまま記載しています。最新の条件は必ず各社の一次情報でご確認ください。

各サービスの補足

PII-Fi(株式会社Qualiteg)

日本語テキストに特化した検出・仮名化サービスです。検出対象は 84 種類の型(識別子 40 型・属性 35 型・認証情報 9 型)で、個人を特定する識別子だけでなく、病名や人事評価のように文脈があって初めて機微になる情報、API キーやアクセストークンのような認証情報まで含みます。仮名化は「同じ値は同じダミーに置き換える」照応保持が既定で、電話番号は電話番号の形のまま、日付は有効な日付のまま置換されるため、仮名化した後のログでも時系列の追跡が壊れません。API の仕様は API v2 開発者ドキュメントに、型の内訳は型カタログにあります。

Microsoft Presidio

Microsoft が MIT ライセンスで公開している OSS の PII 検出・匿名化フレームワークです。公式ドキュメントは「既定の構成では英語の認識器とモデルを含む」と述べ、他言語で使うには NLP エンジンを別言語向けに設定したうえで、言語に依存する認識器(文脈語を含む)を追加する手順を示しています。認識器は 1 つにつき 1 言語の対応です。公式の対応エンティティ一覧に日本向けの国別エンティティはありません。ソフトウェア自体は無料ですが、日本語の氏名・住所を実用精度で検出するには、モデル選定と認識器の実装・評価を自社で行う必要があります。

Azure AI Language PII

Microsoft Azure のクラウド API です。テキスト PII の対応言語表には日本語(ja)が含まれ、日本固有のエンティティとして銀行口座番号・運転免許証番号・マイナンバー(個人・法人)・旅券番号・在留カード番号・住民登録番号・社会保険番号の 8 種が定義されています。データの扱いは、送信したデータを最大 48 時間だけ一時保存してから消去し、PII エンドポイントでは LoggingOptOut が既定で true と明記されています。料金は 1,000 テキストレコード単位の従量課金で、無料枠は月 5,000 テキストレコードです。5 つの中では、日本語対応を公式に明記し、日本固有の番号系エンティティも最も多く持つ汎用 API です。

Google Sensitive Data Protection(旧 Cloud DLP)

Google Cloud のクラウド API で、infoType と呼ばれる検出器を要求ごとに指定して検査・変換します。日本固有の infoType としてマイナンバー(JAPAN_INDIVIDUAL_NUMBER)・銀行口座・運転免許証番号・旅券番号・法人番号の 5 種があります。一方、氏名・住所・電話番号は PERSON_NAME / STREET_ADDRESS / PHONE_NUMBER の汎用 infoType で、日本語テキストへの対応を言語別に記載したページは当社の確認範囲では見つかりませんでした。料金は検査・変換したバイト数の従量課金で、content メソッドは月 1 GB まで無料です。

Amazon Comprehend PII

AWS のクラウド API です。公式ドキュメントは「英語またはスペイン語のテキスト文書」で PII エンティティを検出すると明記しており、日本語には対応していません。国別エンティティもカナダ・インド・英国・米国のみです。データの扱いについては、AWS の AI サービスがサービス改善(モデル学習を含む)のためにコンテンツを使用・保存することがあると明記されており、AWS Organizations のオプトアウト ポリシーで除外できます(Comprehend は対象サービスの一覧に含まれます)。英語圏のデータを AWS 上で処理している場合の選択肢で、日本語の案件では候補から外れます。

精度の数値をこのページに載せない理由

比較表に Recall や F1 の数値を並べていないのは、他社の数値を当社が測って公表するのはフェアでなく、当社自身の数値も評価データの代表性と信頼区間を示さずに 1 つの数字で語るべきではないと考えているからです。この考え方は個人情報検出の精度を、どう正しく語るかにまとめています。PII-Fi の検出精度は、貴社の実データを使った検出デモと、初回契約の 14 日間無料期間でご確認ください。

どう選ぶか

処理するテキストのほとんどが日本語で、問い合わせ記録・障害ログ・議事録のように氏名や住所が自由な書き方で現れるなら、日本語専用に検出を設計したサービスを選ぶのが近道です。汎用 API は番号系のパターンを持っていても、「山田部長」を氏名として拾うか、「一丁目二番三号」と「1-2-3」を同じ住所として拾うかは実データで試すまで分かりません。PII-Fi はここを主戦場にしています。

英語圏のデータが中心で、日本語は一部という構成なら、Azure AI Language PII が現実的です。日本語対応を公式に明記し、日本固有の番号系エンティティも揃っていて、多言語をひとつの API で扱えます。すでに Google Cloud 上にデータがあり、マイナンバーや口座番号のような番号系を主に検出したいなら Google Sensitive Data Protection も候補になります。

データを社外に一切出せず、エンジニアリング工数をかけられるなら Presidio を自前で育てる選択肢があります。ただし日本語の氏名・住所の検出は自分で組み立てることになるので、PoC で「どこまで拾えるか」を先に測ってから判断してください。PII-Fi にもオンプレミス構成があるので、社外に出せない要件そのものは SaaS 以外の形でも相談できます。

出典(2026/09/08 閲覧)

Next step

日本語の実データで、
どこまで拾えるかを確かめる

API の仕様はドキュメントで公開しています。貴社のログや問い合わせ記録を使った検出デモ、オンプレミス構成、プランのご相談はお問い合わせから承ります。初回のご契約はカード登録後 14 日間無料です。