LASSIC Media らしくメディア

2026.10.02 採用支援コラム

外部人材活用で生成AIを本番運用へ移すときの品質基準と更新手順




監修・編集責任者:牛尾 昭昌(株式会社LASSIC 執行役員)

この記事の結論

  • 生成AIを本番運用に乗せる前に、テストの問いと合格の基準を社内で決めておきます。
  • テストの準備や評価、稼働後の監視は外部人材の力を借りやすく、判断は社内に残します。
  • モデルの更新や保守終了に備え、プロンプトとテストの問いを自社の手元に残しておきます。

※ 本記事は2026年10月時点の公式情報(省庁・公的機関、および製品やサービスを提供する事業者が公開している資料)に基づきます。

試しに使ってみた生成AIの仕組みが、社内で評判になった。いざ本番運用に移そうとすると、どこまでの品質なら出してよいのか、誰が見張り続けるのかが決まっていない——。生成AIの本番運用における外部人材活用とは、業務やサービスで使い続けるときに、品質の基準づくり、テスト、稼働後の監視といった作業の一部を社外の専門人材に担ってもらうことを指します。

任せられる相手がいれば、社内に詳しい人が少なくても本番運用へ進めやすくなります。ただし、使い道や合格の基準まで任せると、出来上がったものが自社の業務に合うかを社内で判断できなくなります。本記事では、開発の現場を預かるマネージャーに向けて、社内で決めることと任せる作業、期待品質、テスト、稼働後に見る数字、モデルの更新と費用への備えを整理します。

白い大理石のらせん階段を真上から見下ろした写真。木の手すりが渦を描いて下の階へ続き、中心に向かって段が小さくなっていく。人も文字も写っていない

試しの段階と本番運用の違い

試しの段階では、うまく答えた例をいくつか見て「使えそうだ」と判断できます。本番運用では、同じ問いにいつも同じ水準で答えること、想定していない問いでも崩れないこと、使う人が増えても応答が遅くならないことが求められます。生成AIは同じ入力でも毎回同じ答えを返すとは限らないので、この差は通常のシステムより大きく出ます。

手がかりになるのが、デジタル庁の「テキスト生成AI利活用におけるリスクへの対策ガイドブック(α版)」です。2024年5月29日に初版が決まり、5月30日と6月10日に誤記等の軽微な修正が入った文書で、政府情報システムを対象に、テキスト生成AIに固有と見られるリスクとその軽減策を示しています。*1 国の機関向けの参考資料なので民間企業に守る義務はありませんが、対策は具体的です。なお、案内ページは、内容を今後「行政の進化と革新のための生成AIの調達・利活用に係るガイドライン」へ統合し、その枠組みの中で更新するとしています。*2

生成AIを本番運用に乗せるまでの4つの段階を、左から右へ4つの箱で示した図。1つ目は使い道を決める段階で、生成AIを使うのが適切な業務かを業務から判断し、試しの検討は社内でも行える。2つ目は期待品質を決める段階で、テストの問いの数と合格の基準を決め、委託するなら複数の事業者に相談する。3つ目はテストする段階で、同じテストを繰り返し、評価の観点を分け、複数の人が別々に評価する。4つ目は稼働後で、利用の実績とモデルの変化を見張り、実際の入力をテストに足して評価し直す。下の帯には、社内で持つのは使い道と合格の基準を決めることで、テストや監視の作業は外部人材の力を借りやすいと書かれている。デジタル庁「テキスト生成AI利活用におけるリスクへの対策ガイドブック(α版)」をもとに作成。社内と外部の分け方は本記事の整理。

ガイドブックは、新サービス企画時、予算要求前、調達実施前、設計・開発時、サービス実施時の5つの段階に分けてリスクを並べています。使い方としては、チャットでの対話、大量の文章のバッチ処理、検索エンジンの補助、自然な文章からダッシュボードやソースコードを作る機能の4つを想定しています。

社内で決めることと任せる作業

ガイドブックが想定する読者は、目的の用途に向けたサービスを開発する「サービス開発者」と、そのサービスを運用する「サービス提供者」です。どちらも、その役割を「実施もしくは委託する」立場として書かれています。*1 開発も運用も、社外に頼むことは初めから想定されているわけです。

それでも社内に残したいのは、生成AIを使ってよい業務かどうかの判断です。ガイドブックは適切でない例として、期待する品質が高すぎる場合、本来人間が行うべき仕事の場合、特定の資格が要ると法令で定められた作業の場合、生成AIの知識に無いことを答えさせる場合、構築と運用の費用が効果に見合わない場合、AI事業者ガイドラインの「共通指針」に反する場合の6つを挙げています。*1 どれも業務の中身を知らないと判断できません。

試しの検討も、ある程度までは社内でできます。ガイドブックは、プロンプトを変えるだけで多様な用途に対応できるので、AIの専門家でなくても何ができそうかを事業者に頼らずに検討できるとしています。一部のモデルでしか検討できないと特定の事業者に縛られやすくなるため、職員が複数のモデルを試せる状態が望ましいとも書いています。

本番運用に向けた作業と、社内・外部人材の分け方の例(ガイドブックの記載をもとに本記事が整理)
作業 社内で持つこと 外部人材の力を借りやすいこと
使い道を決める 生成AIを使ってよい業務かの判断 技術的にできそうかの見立て
期待品質を決める 合格の基準と、許せる誤りの種類 現実的な品質の水準についての助言
テストする 業務の正解を示すこと テストの問いの整備、評価の仕組みづくり
稼働後に見張る 止める・直すの判断 指標の監視、テストの追加と再評価
モデルを更新する 切り替えるかどうかの判断 移行先のモデルでの検証

本番の前に決める期待品質

ガイドブックは、調達を始める前に、生成AIの出力にどこまでの品質を期待するかを明確にするよう求めています。チャットの例では、ごみの出し方の案内であれば、ごみの種類や捨て方ごとに10種類、まったく関係ない質問を100種類作り、その質問の99%以上で妥当な回答を返すことを要件に入れる、という形を示しています。*1

この基準が現実的かどうかは問題の難しさで変わるので、社内だけで決め切るのは難しいところです。ガイドブックは、委託して開発する場合、要件を作るときに複数の事業者に相談することを勧めています。返ってきた現実的な品質の水準が受け入れにくいなら、まだ技術が追いついていないとみなし、中止も考えに入れるよう求めています。*1 外部人材の知見を借りる場面として、最初に来るのがここです。

バッチ処理で使う場合は、誤りの種類を分けます。書類審査の例では、不合格にすべき書類を合格にする誤りと、合格の書類を不合格にする誤りに分け、それぞれどこまで許せるかを決めます。前者が許せないなら、生成AIが合格とした書類は人が審査し直す組み方になります。どちらの誤りが重いかは業務によって違うので、ここは社内で決めることです。

検索の補助なら再現率と適合率を受け入れの基準にでき、応答時間の目標も別に要ります。自然な文章から集計を出す機能なら、問いと人が出した正解の数字の組を用意し、正答の割合で基準を作れます。

テストの回し方

ガイドブックは品質の評価について、生成結果がばらつくこと、品質の評価そのものが難しいこと、テストの問いの網羅が足りなくなることの3つのリスクを挙げています。*1 ばらつきへの対策には、関わるパラメータの調整、出力の形式の指定、同じ入力で何回かテストすること、同じ入力には保存しておいた出力を返す仕組みが並んでいます。

評価の難しさへの対策は、観点を分けることです。検索した文章をもとに答えさせる仕組みなら、適切な文章を拾えているか、出力が拾った文章に書かれた内容か、最終的な出力が形式どおりか、と分けて見ます。複数の人が別々に評価して結果を合わせるやり方も挙がっていますが、全員が同じ種類の偏りを持っていればリスクは減らず、人件費と期間ははっきり増えるとしています。*1 社内の担当者だけでは偏りがそろいやすいので、社外の専門人材を評価者に加える意味はここにあります。

テストの問いを増やすには、過去に実際にあった問い合わせとその回答をそのまま使うのが安上がりです。そのうえでガイドブックは、品質を保つ最も確かな手段は、テストしていないケースでは生成AIの出力を使わないことだとしています。*1

稼働後に見る数字

サービスを始めた後は、予算を取るときに決めたKPI(重要業績評価指標)を測ります。ガイドブックは、バッチ処理なら同時に受けるリクエストの上限、リクエストの成功率、目標の処理時間といった指標を監視するとしています。検索の補助なら、生成AIを入れた場合と入れない場合を比べるA/Bテストを積極的に行うよう勧めています。

チャットで使う場合は、利用者の入力文の扱いに注意が要ります。ガイドブックは、利用規約などに書いてあっても、入力文を管理者が実績データとして確認すること自体がプライバシーの侵害とみなされるリスクがあるとしています。*1 誰がどの範囲で入力文を見るかは、運用を社外に頼むならなおさら、先に社内で決めて契約にも書いておきたいところです。

実際の入力がテストの問いに無ければ、それを加えて評価し直します。ガイドブックは、使われ方が当初の想定から外れることと、使っている大規模言語モデルが変わることの2つで要件を満たさなくなるリスクがあり、その場合は直すだけでなく、サービスの停止や終了も考えに入れるべきだとしています。*1 監視を外部人材に任せるなら、異常に気づいたときに誰へ知らせ、誰が止めるかを決めておきます。

モデルの更新と乗り換えへの備え

クラウドのWeb API(外部から呼び出す窓口)で大規模言語モデルを使う場合、ガイドブックは、日々の更新やEOL(保守終了)によって、自分たちで十分にテストできていないモデルを使わざるを得なくなるケースがあると注意しています。*1 保守終了の前に移行先の候補で十分な性能が出るかを確かめておけば、影響を前もって見積もれます。実際のプロンプトを入れる内部のテストと、新しいモデルを段階的に出して比べるA/Bテストが挙がっています。

別のクラウドの窓口に切り替えるときに要る対応として、ガイドブックは次の3つを挙げています。*1

別のクラウドのWeb APIに切り替えるときに要る対応(デジタル庁ガイドブック 付録7.2 5)。資料の記載をもとに作成)
番号 対応
1 異なる大規模言語モデルを使う場合の、プロンプトの調整
2 Web APIに送るリクエストの形式
3 その他、接続先やネットワークの設定、認証情報など

この手間が極めて大きいと、特定の事業者から離れられなくなるリスクが増すとしています。違いを吸収する開発用の枠組みを入れると今度はその枠組みに縛られるため、早すぎる最適化をしないよう慎重に検討するよう勧めています。外部人材に作ってもらう場合も、プロンプトとテストの問い、評価の結果は自社の手元に残してもらうと、モデルを替えるときに同じテストを当てられます。

費用の見張り方

Web APIで使う場合、多くは入力の量と出力の量のそれぞれに比例して料金がかかります。ガイドブックは、リクエストの数だけでなく中身や出力にも費用が左右されるため予測が難しく、見積もりの誤りによる予算超過や利用停止のリスクが起こりうるとしています。*1

対策には、事前のテストの結果から入出力の量を悲観的に見積もること、出力の量の上限をパラメータで決め、入力の文字数を制限する仕組みを手前に置いて1回あたりの費用を抑えることが挙がっています。動いている仕組みがあれば、実績をもとに定額の契約から従量の契約へ見直せないかも検討するとしています。生成AIを組み込んだ既製のサービスでは、異動や退職に合わせたアカウントの管理の手間が無視できないほど大きく、社内のシングルサインオンにつなげれば大きく減らせるとしています。

外部に委託するときに確認しておきたい点

生成AIの本番運用に外部人材の力を借りる前に、社内で用意しておきたいものは3つです。使い道と許せる誤りの種類、合格の基準を書いたもの、テストの問いの元になる過去の問い合わせや業務の記録です。これがあれば、頼みたいのが評価の仕組みづくりか、稼働後の監視か、モデルの乗り換えかがはっきりし、参画してもらう人を選びやすくなります。異常のときに誰が止めるか、入力文を誰がどこまで見るかも、参画の前に伝えておきます。

導入の段階で専門家の支援がどう役立ったかは外部人材活用で進める生成AIの導入、社内と専門家の役割の違いで扱っています。

生成AIの仕事を頼むときの手順は外部人材活用で生成AIの仕事を頼むときに行う5つのことにまとめました。

生成AIに限らない試験導入からの移り方は外部人材活用のPoC(概念検証)を本番化するときの課題と体制で整理しています。

まとめ:本番運用で確かめておきたい3つの点

生成AIを本番運用に乗せるうえで、確かめておきたい点は3つに整理できます。第一に、生成AIを使ってよい業務かどうかと、テストの問いと合格の基準を社内で決めておくこと。第二に、テストの準備と評価、稼働後の監視は外部人材の力を借りつつ、止める・直すの判断は社内に残すこと。第三に、モデルの更新や保守終了に備え、プロンプトとテストの問い、評価の結果を自社の手元に残すことです。この3点を踏まえておけば、「評判のよかった試作をそのまま出したら、想定外の問いで崩れた」という事態を避けやすくなります。任せたい作業に合う人の探し方に迷いがあれば、外部の手を借りるのも一つの選択肢です。

LASSICに相談するメリット

合格の基準と任せたい作業が書き出せたら、次はその作業を担う人を探す段階です。評価の仕組みづくり、稼働後の監視、モデルの乗り換えのどれを頼みたいかが決まっていれば、求める経験がはっきりし、候補者を探しやすくなります。

Remoguは、株式会社LASSICが運営するフリーランス・業務委託のITプロ人材サービスです。リモート前提で全国から登録が集まっており、登録は約20,000名規模、その約8割が開発系です。人材が必要になった時点から4時間以内に候補者を提案し、最短1週間で実際の業務開始まで進みます(条件によっては実現できない場合があります)。

よくある質問

試しの段階を担当した外部人材に、本番運用もそのまま任せてよいですか

任せること自体はできます。ガイドブックも、開発と運用のどちらも委託する場合を想定しています。ただし、試しの段階で要った技術と、稼働後に指標を見張りテストを加え続ける作業は中身が違います。本番運用で頼みたい作業を書き出し、その経験があるかを改めて確かめておきます。契約の形や責任の範囲は、契約や専門家に確かめてください。

テストの問いはどのくらい用意すればよいですか

決まった数はありません。ガイドブックも、どこまで作るべきかはプロジェクトの性質に依存し、一概に決めるのは難しいとしています。*1 そのうえで、生成AIに持たせる役割をはっきりさせるほど、必要な問いの数を減らせるとしています。チャットで使うなら、答えるテーマを決めてそれ以外には答えさせない作りにすると、テストの問いを絞り込めます。

本番運用を始めた後に回答の質が落ちたときは、どうすればよいですか

まず、使われ方が想定から変わったのか、使っているモデルが変わったのかを確かめます。ガイドブックは、この2つの変化を見ておくことが、要件を満たさなくなる前に気づくためにも、満たさなくなった後に原因を調べるためにも重要だとしています。直して戻せない場合は、サービスの停止や終了も考えに入れます。

任せたい作業が決まったら相談

生成AIの本番運用で外部人材に任せたい作業と、合格の基準が分かっていれば、そのままご相談いただけます。どこまでを社内で持つか決めきれていない段階でも構いません。

Remoguとリラシクなら、リモートワークで働く社員の候補者も、業務委託で開発に加わる専門人材も探せます。

Remoguは、リモート前提で全国から即戦力のITプロ人材を調達するサービスです。リラシクは、扱う求人がすべてリモートワークのITエンジニア専門転職エージェントです。どちらもLASSICが運営しています。

無料相談はこちら

出典

  1. *1 参考:デジタル庁「テキスト生成AI利活用におけるリスクへの対策ガイドブック(α版)」(2024年6月10日、PDF)(https://www.digital.go.jp/assets/contents/node/basic_page/field_ref_resources/c1959599-efad-472e-a640-97ae67617219/fe843dc6/20240610_resources_generalitve-ai-guidebook_01.pdf)。出典:改定履歴、1.1(目的とスコープ・表1)、1.2、1.3、2.1、2.3、3.1 3)・4)、4.1〜4.4、5.2、6.1〜6.3、付録7.2 4)・5)・7.2.6を参照(確認日2026年10月2日)(2026年10月確認)
  2. *2 参考:デジタル庁「テキスト生成AI利活用におけるリスクへの対策ガイドブック(α版)」(案内ページ)(https://www.digital.go.jp/resources/generalitve-ai-guidebook)。出典:最終更新日2025年6月6日。生成AIの調達・利活用に係るガイドラインへの統合についての記載を参照(確認日2026年10月2日)(2026年10月確認)




View