契約書作成・電子契約締結 ContractS コントラクツ

契約業務改善 ガイドをダウンロード

契約業務改善ガイドをダウンロード

ノウハウ AIの出力をどう監督するか|3つの監督モデルと、確認頻度を段階的に下げる品質管理の運用

更新日:2026年10月8日

投稿日:2026年10月9日

AIの出力をどう監督するか|3つの監督モデルと、確認頻度を段階的に下げる品質管理の運用

AIの出力をどう監督するか|3つの監督モデルと、確認頻度を段階的に下げる品質管理の運用

「任せたあと」をどう管理するか

契約審査の前さばきや一次レビュー、契約管理の定型作業など、AIに任せられる業務の範囲は広がっています。AIに任せる業務の切り分けや、自動化の進め方を検討する企業も増えていると考えられます。

ただ、実際に業務を渡したあとには、別の問いが残ります。AIが出した結果を、誰が、どの頻度で、どこまで確認するのか。全件を人が読み直していれば、AIに任せた意味が薄れます。かといって確認をやめてしまえば、誤りに気づく手段がなくなります。

本記事では、この「任せたあと」の管理を、AIの出力の監督と品質管理という観点から整理します。監督の水準の選び方、確認頻度を段階的に下げる手順、品質の測り方、頻度を戻す条件、そして監督の記録を基準の改善に回す方法を順に解説します。どの業務をAIに渡すかという前段の論点は「AIに任せる業務、人間が残す業務の切り分け方」で扱っています。

AIの監督には3つの水準がある

AIに業務を渡すかどうかは、「任せる/任せない」の二択ではありません。人がどのように関与するかによって、少なくとも3つの水準に分けて考えることができます。この整理は、EUのAI法(AI Act)が高リスクAIに求める人間による監督の考え方とも重なり、AIガバナンスの実務で広く使われています。

水準1:Human-in-the-Loop(実行前承認型)

  • 人の関わり方:AIの処理結果を、実行前に人が1件ずつ承認する
  • 向いている業務:リスクが高い業務、外部に出る判断
  • 特徴:統制は強いが、処理速度は人に依存する

水準2:Human-on-the-Loop(監視型)

  • 人の関わり方:AIが実行し、人は結果を監視して、問題があれば介入する
  • 向いている業務:リスクが中程度で、誤りを後から修正しやすい業務
  • 特徴:速度と統制のバランスを取りやすい

水準3:Human-in-Command(統括型)

  • 人の関わり方:人はリスクの閾値と停止の権限を持ち、個別案件には関与しない
  • 向いている業務:定型度が高く、影響が限定的な業務
  • 特徴:最も速いが、閾値と停止条件の設計が前提になる

水準1から3に進むほど、人が個別案件に関わる度合いは小さくなり、処理は速くなります。その分、閾値や停止条件といった「仕組みの設計」に求められる精度が高くなります。

重要なのは、組織全体で1つの水準を選ぶのではなく、業務ごとに水準を決めることです。同じNDAでも、自社ひな形どおりの案件と、相手方が大きく修正したドラフトとでは、適した監督の水準が異なると考えられます。

業務ごとに監督の水準を決める3つの軸

監督の水準を選ぶ際は、次の3つの軸で業務を評価すると判断しやすくなります。

1. 誤りが生じたときの影響の大きさ

AIの判断が外部に出るか、金額や責任範囲に直結するか、という観点です。相手方への回答や締結に関わる判断は影響が大きく、社内向けの整理や台帳の更新は相対的に小さいといえます。

2. やり直しのしやすさ

誤りに後から気づいたとき、修正できるかどうかです。社内の分類や記録は後から直せますが、送信済みの回答や締結済みの契約は取り消しにくくなります。

3. 判断の定型度

過去に同じような判断が繰り返されているか、例外が少ないか、という観点です。定型度が高い業務ほど、AIの判断が安定しやすくなります。

  • 相手方への修正提案の送付
    • 評価:影響は大きい/やり直しは難しい/定型度は中程度
    • 監督の水準の目安:実行前承認型
  • NDAの一次レビュー結果
    • 評価:影響は中程度/やり直しは可能/定型度は高い
    • 監督の水準の目安:監視型
  • 依頼の不足情報の差し戻し
    • 評価:影響は小さい/やり直しは可能/定型度は高い
    • 監督の水準の目安:監視型から始め、統括型へ移行
  • 契約台帳の項目補完の提案
    • 評価:影響は小さい/やり直しは可能/定型度は高い
    • 監督の水準の目安:統括型(ただし台帳への反映は承認制)

上記の水準はあくまで目安です。自社の取引の性質や、業務を始めたばかりかどうかによって適切な水準は変わります。移行の初期は一段階厳しい水準から始め、運用実績を見ながら緩めていくのが安全です。

監督の水準が合っていないと何が起きるか

監督の水準は、厳しすぎても緩すぎても問題が生じます。それぞれの場合に起きやすいことを整理しておくと、水準を見直す判断がしやすくなります。

水準が厳しすぎる場合

定型的で影響の小さい業務まで実行前承認型にすると、承認待ちの案件が人の手元にたまり、AIに任せる前と処理速度がほとんど変わらなくなります。担当者がAIの出力を一から読み直す状態が続くと、「AIを入れても楽にならない」という評価につながりやすくなります。

水準が緩すぎる場合

影響の大きい業務を監視型や統括型にすると、誤りが外部に出てから気づくおそれがあります。とくに、相手方への回答や締結に関わる判断は、後から取り消すことが難しいため注意が必要です。

水準が固定されたままの場合

運用開始時に決めた水準を見直さずにいると、品質が安定しても負荷が下がらない、あるいは対象を広げたのに監督が追いつかないといった状態になります。水準は一度決めて終わりではなく、記録に基づいて定期的に見直すものとして扱うのが望ましいです。

このように、監督の水準は「AIの性能」だけでなく「業務の性質」と「運用の実績」で決まります。導入時に水準を決めたら、あわせて見直しのタイミング(たとえば四半期ごと)も決めておくとよいでしょう。

確認頻度を段階的に下げる

監視型で運用する場合でも、最初から抜き取り確認にするのではなく、確認の頻度を段階的に下げていく進め方が考えられます。進め方の一例を示します。

ステップ1:開始直後(全件・数時間ごと)

  • 確認の頻度と範囲:全件を数時間ごとに確認する
  • ステップ2に進む条件の例:一定件数を処理し、重大な誤りがない

ステップ2:2週間前後(日次)

  • 確認の頻度と範囲:日次で、全件または重点類型を確認する
  • ステップ3に進む条件の例:人の修正が必要な割合が基準を下回る

ステップ3:1か月前後(週次)

  • 確認の頻度と範囲:週次で確認し、サンプルに絞って集中的に見る
  • ステップ4に進む条件の例:週次の確認でも誤りの傾向が安定している

ステップ4:半年前後(月次の抜き取り)

  • 確認の頻度と範囲:月次で、全体の10〜20%程度を抜き取って確認する
  • その後の扱い:この頻度を維持し、条件を満たさなくなったら前のステップに戻す

期間はあくまで目安で、処理件数や業務の性質によって前後します。大切なのは、期間ではなく「次に進む条件」で段階を管理することです。条件を満たしていないのに期間が来たからといって頻度を下げると、誤りが見逃されやすくなります。

💡確認頻度を下げる判断は、担当者の感覚ではなく記録に基づいて行うのが望ましいです。何件を確認し、そのうち何件で人が修正したかを残しておけば、段階を進める根拠を説明しやすくなります。

品質をどう測るか

確認頻度を下げてよいかを判断するには、AIの出力の品質を測る指標が必要です。契約業務では、次のような指標が使いやすいと考えられます。

  • 人の修正率:AIの出力のうち、人が修正した件数の割合
  • 重大な誤りの件数:見落とすと実害につながる誤り(必須の論点の見落としなど)の件数
  • エスカレーションの妥当性:人に回すべき案件が正しく回っているか、逆に不要な案件まで回っていないか
  • 差し戻しの往復回数:依頼者への差し戻しが1回で済んでいるか

特に重要なのは、修正率と重大な誤りを分けて扱うことです。表現の手直しのような軽微な修正が多くても、重大な誤りがなければ頻度を下げる判断はしやすくなります。反対に、修正率が低くても重大な誤りが1件でもあれば、その原因を確認するまで段階を進めないほうが安全です。

法務の評価指標そのものをどう変えていくかについては「法務のKPIはどう変わるか」も参考になります。

抜き取り確認の設計

確認頻度を下げた段階では、どの案件を確認するかの選び方が品質管理の精度を左右します。抜き取りは、次の2種類を組み合わせると偏りを抑えやすくなります。

ランダム抽出

全体から無作為に選ぶ方法です。AIの出力全体の品質の傾向をつかむのに向いています。

重点抽出

特定の条件に当たる案件を優先して選ぶ方法です。たとえば、新しく対象に加えた類型、取引金額の大きい案件、AIが判断の確信度を低く示した案件、普段と異なる事業部からの依頼などが考えられます。

ランダム抽出だけでは、件数の少ない種類の案件が確認から漏れやすくなります。重点抽出だけでは、全体の傾向が見えにくくなります。両方を組み合わせ、確認した結果を記録しておくことが、次の判断の材料になります。

頻度を戻す条件を先に決めておく

確認頻度を下げる条件と同じくらい重要なのが、頻度を戻す条件です。運用が安定していても、次のような変化があればAIの出力の品質は変わり得ます。

  • 法改正や社内規程の変更で、判定基準が変わった
  • 対象の類型や事業部を広げた
  • 利用するAIのモデルや、AIに渡す手順書(スキル)を更新した
  • 抜き取り確認で重大な誤りが見つかった

こうした変化があったときは、一段階前の確認頻度に戻し、品質を確かめてから再び下げる運用にしておくと安全です。戻す条件をあらかじめ決めておけば、担当者が個別に判断に迷う場面を減らせます。

📝AIの能力を評価することと、AIにどこまで判断の権限を与えるかは別の問題です。AIの分析が正確でも、その判断が自社の承認権限の範囲を超えていれば、人が引き取る必要があります。監督の水準を決めることは、AIに与える権限の範囲を明示することでもあります。

監督の記録を、基準の改善に回す

監督の過程で得られる情報は、品質の確認だけでなく、判定基準そのものの改善にも使えます。特に役立つのが、人がAIの出力をどう修正したかという「修正差分」の記録です。

修正差分がたまってくると、「この条項については、毎回同じ方向に人が直している」といった傾向が見えるようになります。その傾向は、AIに渡している基準と実際の運用がずれている兆候と考えられます。月末などの決まったタイミングで差分を集計し、基準の更新案をつくって人が採否を判断する運用にすれば、AIの判断を少しずつ自社の実態に近づけていけます。基準の更新を人が承認する形にしておくことで、AIが勝手にルールを書き換える状態を避けられます。

暗黙知を言語化して基準に取り込む方法は「契約レビューの属人化を解く「暗黙知の言語化」」で、基準の構造は「リーガルプレイブックの作り方」で詳しく解説しています。

法務の役割は「確認者」から「監督者」へ

確認頻度が下がっていくと、法務担当者の仕事の中身も変わります。案件ごとに前さばきやレビュー結果を確認する役割から、抜き取りでAIの出力品質を監督し、基準を維持・改善する役割へと重心が移っていきます。

この変化によって、法務が件数そのものに追われる状態は緩和されやすくなります。一方で、監督の水準の設計、品質指標の運用、基準の更新判断といった、これまでとは異なる仕事が生まれます。こうした役割の変化については「これからの法務担当者に必要なスキル」でも整理しています。

運用の具体例:NDAの一次レビューを監視型で回す場合

ここまでの考え方を、NDAの一次レビューをAIに任せる場合に当てはめると、運用は次のようになります。

1. 監督の水準を決める

自社ひな形どおりのNDAは「監視型」、相手方ドラフトで修正が多いものは「実行前承認型」とし、種別によって水準を分けます。相手方への回答の送付は、どちらの場合も人が承認してから行います。

2. 開始時の確認体制を決める

開始直後は、AIの一次レビュー結果を担当者が全件確認します。確認のたびに「修正なし/軽微な修正/重大な修正」の3区分で記録し、重大な修正の場合は理由を一言残します。

3. 段階を進める条件を決める

たとえば「直近50件で重大な修正が0件、軽微な修正が一定割合以下」を満たしたら日次確認に移る、といった条件を設定します。数字は自社の件数や許容度に合わせて決めます。

4. 抜き取りの重点条件を決める

抜き取りの段階では、ランダム抽出に加えて「新規取引先」「有効期間が通常より長い」「損害賠償条項に修正がある」といった条件の案件を優先的に確認します。

5. 戻す条件を決める

プレイブックの改定、対象の事業部の追加、AIのモデル変更があった場合は、一段階前の確認頻度に戻します。

6. 月次で振り返る

月末に修正差分を集計し、同じ方向の修正が繰り返されている条項があれば、基準の更新案をつくって法務の責任者が採否を判断します。

このように、水準・段階・抜き取り・戻す条件・振り返りの5点を最初に決めておくと、担当者が替わっても同じ品質管理を続けやすくなります。前さばきや一次レビューをAIに任せる全体像は「契約レビューをAIエージェントに丸ごと任せる」も参考になります。

よくある質問

Q. 抜き取り確認に移ったあと、見落としが起きたら誰の責任になりますか。

AIの出力を検証する責任と、結果を引き受ける責任は、AIではなく人と組織に残ります。そのため、どの業務をどの水準で監督し、どの条件で確認頻度を下げたかを記録として残し、責任の所在を説明できる状態にしておくことが重要です。監督の水準と段階を進めた根拠が記録されていれば、見落としが起きた場合も原因の特定と再発防止につなげやすくなります。

Q. 確認頻度を下げる目安の数字はありますか。

業務の性質や件数、組織の許容度によって異なるため、一律の目安を示すのは難しいと考えられます。重大な誤りの件数と、人の修正が必要な割合の2つを指標にし、自社で許容できる水準を最初に決めておく進め方が現実的です。

Q. AIのモデルを新しいものに切り替えたときは、どうすればよいですか。

モデルの切り替えは、出力の傾向が変わる可能性がある変化です。一段階前の確認頻度に戻し、一定件数を処理して品質に問題がないことを確かめてから、再び頻度を下げる運用が安全です。どのAIを使うかを自社で選べる環境であれば、モデルを切り替えるたびにこの手順を踏むことで、品質を保ちながら新しいモデルを取り入れやすくなります。

Q. 監督の仕組みは、どの部門が設計すべきですか。

対象業務を最もよく知る法務部門が中心になりつつ、権限やデータの取り扱いについては情報システム部門やセキュリティ部門と連携して設計するのが望ましいと考えられます。

監督を支える基盤:記録・承認・権限

ここまで述べた監督の運用は、AIの能力だけでは成り立ちません。次のような仕組みが必要になります。

  • AIが処理した結果が案件ごとに記録され、後から辿れること
  • AIの結果を人が承認・差し戻しでき、その履歴が残ること
  • AIが触れてよいデータと実行してよい操作が、権限として定義されていること
  • 確認の結果と修正差分を集計できる形で残せること

汎用AIをチャット画面で使うだけでは、これらを担当者の手作業で補うことになりがちです。そこで、契約と案件の記録・承認・権限をCLMに集め、外部の汎用AIから読み書きできるようにする「オープン型CLM」という選択肢があります。ContractS CLMはその実装の一つで、「AIは選び、契約は1箇所に集める」という考え方に基づいています。承認や記録がなぜAIの外側に必要かは「AIで契約業務を自動化しても“内部統制”は残る」でも解説しています。

まとめ

AIに契約業務を任せたあとの品質管理は、次の流れで設計できます。

  • 業務ごとに、実行前承認型・監視型・統括型のどの水準で監督するかを決める
  • 水準は、誤りの影響・やり直しのしやすさ・判断の定型度の3軸で評価する
  • 確認頻度は期間ではなく「次に進む条件」で管理し、段階的に下げる
  • 修正率と重大な誤りを分けて測り、抜き取りはランダムと重点を組み合わせる
  • 基準の変更や対象の拡大があれば頻度を戻す条件を、先に決めておく
  • 修正差分を集計し、人の承認を経て基準の改善に回す

まずは、現在AIに任せている(または任せようとしている)業務を一覧にし、それぞれの監督の水準と、次の段階に進む条件を書き出すところから始めてみてはいかがでしょうか。


本記事はContractS株式会社のコンテンツマーケティングチームが、エンタープライズ企業の法務・経営・管理部門向けに執筆したものです。AIエージェントを契約業務に組み込む際の判断は、必ず自社の業務特性・リスク許容度に応じて行ってください。本記事はリーガルアドバイスではありません。

著者名

ContractS編集部

ContractSは、契約プロセスの構築や契約管理・案件管理を通じて、契約業務を最適化するシステム「ContractS CLM」を開発・販売しています。大企業から中小企業、スタートアップまで、幅広い企業の契約業務改善を支援してきた実績があり、そのコンサルティング経験を活かして、契約業務に関わる読者が参考にできる情報を発信しています。