知識テストだけでは実務能力を見誤る
AIが答えを生成する時代にも知識は欠かせない。安全規則、製品基準、法的義務、基本概念を知らなければ適切に判断できない。問題は、選択式や短い記述の点数だけで「その仕事を任せられる」と判断することである。答えを知ること、AIが作った答えの誤りを見抜くこと、不完全な情報で決定し責任を負うことは別の能力だ。
実際の仕事でAIを使う職種なのに、試験だけ一律にAIを禁止すれば実務遂行を十分に測れない場合がある。反対に、AIを無制限に認め、完成品だけを提出させれば、本人がどこで判断したか分からない。禁止か許可かを先に決めるのではなく、測定したい能力と必要な証拠を先に定めるべきである。
ここでいうオーセンティックな能力評価とは、実際の仕事またはそれに近い条件で課題を実行させ、成果と判断過程が職務基準を満たすかを確認する方法である。単に実務らしいストーリーを付けるだけでは足りない。時間、データ、関係者、リスク、確認工程、品質基準が職務の核心を反映している必要がある。
知識テストとパフォーマンス評価では見える能力が違う
| 評価要素 | 知識テスト中心 | 実務遂行中心 |
|---|---|---|
| 問い | 何を知っているか | 条件の中で何を実行できるか |
| 課題 | 選択式・短答・概念説明 | 文書・分析・対話・判断・改善 |
| AI条件 | 一律禁止または検出 | 目的に応じて禁止・制限・許可 |
| 証拠 | 最終答案と点数 | 成果物、出典、判断、修正、レビュー |
| 採点 | 正解との一致 | 正確性、判断、品質、安全、説明 |
| フィードバック | 誤答の訂正 | 過程の弱点と次の遂行改善 |
実務型が常に優れているわけではない。基礎知識や法定必須事項を短時間で確認するなら知識テストは有効だ。しかし、配置、昇格、社内認定、高リスク業務の権限など重要な判断ほど、一つの形式だけに依存する危険が大きい。知識確認と実務証拠を組み合わせる方がよい。
OECDの2026年VET報告書は、職業教育の全体を開発、提供、評価、成果に分ける。評価には、資格・カリキュラムに基づく試験問題と課題の開発、学習成果と評価方法に沿った評価、試験結果の検証、習得スキルの認定が含まれる。評価は問題作成だけでなく、基準設定から結果検証まで続く一つのサイクルである。

評価は試験問題の生成だけでなく、学習成果、評価方法、結果検証、スキル認定までを含む。
成果物だけでなく判断過程を証拠にする
完成度の高い報告書一つで能力全体を証明することはできない。他人のテンプレートやAIに大きく依存した可能性があり、偶然よい結果になっただけかもしれない。反対に、初稿は不十分でも、誤りを見つけ、根拠を確認し、修正する過程に高い能力が表れることもある。
証拠は四つに分けると扱いやすい。
- 最終成果物:報告書、コード、分析、顧客対応記録、設計案、意思決定メモ
- 根拠:使用したデータ・情報源、仮定、制約、検証方法
- 過程:初稿、AI利用範囲、主要な選択、フィードバック前後の修正
- 説明:評価者の質問に判断理由と代替案を答える短い口頭確認
全プロンプトの提出を強制する必要はない。課題で許可されたAIの範囲と、本人が行った検証を示せればよい。市場分析ならAIで初稿を作ることを認めつつ、主要数値の原典確認、矛盾する資料の扱い、最終提言の責任を人が示す。機密情報を扱う職種では、サンドボックスデータと承認済みツールだけを使わせる。
OECDのPISA 2029 Media and AI Literacy評価フレームワーク初稿も、学校、仕事、余暇、市民生活、社会関係に関わる現実的課題を用い、分析、情報評価、協働、創作を見ようとしている。専門家グループは、評価時間の半分を「分析・評価」と「創作」に25%ずつ割り当てるよう勧めた。企業の職務評価へそのまま移すことはできないが、知識再生より判断と制作に十分な時間を置く原則は参考になる。
AI禁止・制限利用・自由利用を目的で分ける
評価パッケージには三つの区間を組み合わせられる。
一つ目はAI禁止区間である。緊急時の安全手順、重要規則、ツール停止時の対応など、外部支援なしですぐに思い出す必要がある知識と判断を見る。禁止理由と監督方法を明示し、必要範囲だけ短く測る。
二つ目はAI制限利用区間である。承認済みツール、指定データ、特定機能だけを認める。AI出力を検証し修正する力を見るため、実際の職場統制に最も近い条件を作りやすい。
三つ目はAI自由利用区間である。ツールと方法を本人に選ばせる代わりに、出典、仮定、限界、品質検証、人の責任を説明させる。生産性だけでなく、道具の選択と監督能力を見る。
この区分なら「AIを使えば不正」と「AIを使えば能力がある」という両極端を避けられる。同じ職種でも、緊急対応の知識はAI禁止、顧客データ分析は制限利用、業務改善案は自由利用と設計できる。
EU理事会の2026年結論は、教育・訓練におけるAI関連の決定を教育目的に基づかせ、AIが教師の専門的判断と責任を置き換えないよう求める。教師にはAI出力を批判的に評価し、限界とバイアスを説明し、ツールの共同設計・選定・評価・文脈調整へ関与する役割がある。企業研修でも、AI採点が評価者の職務判断を代替しない基準として読める。

AIは専門的判断を支援するものであり、教育者は出力の限界・バイアスを評価して設計と選定に関与する。
職種別の実務評価パッケージを組み立てる
最初は評価主張を定める。「AI活用力」のような広い表現ではなく、観察できる文章にする。例えば「顧客データを保護しながらAI要約の重大な誤りを発見・修正し、最終回答の根拠を説明できる」と書く。
次に仕事の標本を選ぶ。すべての業務は試せないため、頻度、リスク、事業重要性、学習可能性から3〜5の重要場面を選ぶ。熟練者一人の記憶だけに依存せず、実際のエラー、問い合わせ、品質記録、複数の優秀者インタビューを使う。
三つ目は条件と資源である。時間、ツール、データ、協働、参照資料、AI利用範囲を実務に近づける。情報不足や利害対立を意図的に置くと、単純な正解ではなく判断が表れる。
四つ目は採点ルーブリックである。正確性だけでなく、問題定義、根拠の質、リスク認識、AI出力検証、意思決定、コミュニケーション、修正力を分ける。「良い・普通・不足」ではなく、各段階で観察される行動と重大エラーを書く。
五つ目はフィードバックと再挑戦である。評価を選抜だけでなく人材育成に使うなら、何を直せば次の水準へ進めるかを伝える。初回から再試行への変化も大切な学習証拠になる。
営業管理職なら、顧客要望と社内収益データから提案優先順位を作らせる。AIで下書きを作ることは認めても、数値の原典、反対根拠、顧客別リスク、最終判断メモを提出させる。その後、評価者が前提条件を変える質問をし、成果物ではなく判断モデルを確かめる。
社内認定に使うなら採点の信頼性を守る
実務評価は現実に近い分、採点者の判断が入る。評価者は例示成果物で事前に基準を合わせ、境界点や高リスクな認定は二人が独立採点する。差が出たときは、どのルーブリック項目で判断が分かれたかを記録する。
AI採点を使っても人の最終確認をなくさない。AIは漏れの確認やルーブリック適用の下書きを支援できるが、職務上の例外、合理的配慮、創造的な代替案を落とす可能性がある。モデル版、入力、基準、人が修正した理由を残し、定期的に標本を再採点する。
受験者にも透明性が必要だ。評価対象、AIを使える範囲、収集データ、配置・昇格・認定への利用、異議申立てと再評価を説明する。障害、言語、ツールアクセスの差には合理的配慮を行いながら、測定したい中核能力は維持する。
日本企業では、職能資格や昇格試験に知識テストが長く組み込まれている場合がある。すべてを一度に置き換える必要はない。まず一つの職務等級で、既存テストに実務課題、口頭確認、再挑戦を加え、OJTでの上司観察と照合する。人事評価と育成評価の目的が違う場合は、データ利用も分ける。
配置・昇格へつなぐ前に越える五つの妥当性基準
第一は内容妥当性である。課題が実際の職務で重要な場面と基準を代表しているか。
第二は過程妥当性である。高得点が意図した判断・検証力によるものか、ツール経験やテンプレートへのアクセス差によるものか。
第三は採点一貫性である。評価者や時点が変わっても、同程度の遂行に近い結果が出るか。
第四は結果の公平性である。性別、年齢、障害、言語、雇用区分による通過率とエラーを確認し、少人数集団の個人情報を守る。差を能力差と即断せず、課題文脈、アクセス、採点偏りを調べる。
第五は予測・移転証拠である。評価結果と、その後の業務品質、エラー、自立遂行、上司観察との関係を見る。関係が弱ければ課題とルーブリックを変える。
AI時代の能力評価は、AI利用を摘発するための仕組みではない。AIを含む実際の仕事で問題を定義し、根拠を確認し、リスクを管理し、結果を説明し、フィードバック後に改善できるかを確認するものである。正解数を数える試験から、仕事の証拠を検討する仕組みへ移ることで、研修修了と実際のスキルの距離を縮められる。
日本企業では一つの社内認定から評価者校正を始める
全社の昇格試験を一度に変える必要はない。まず一つの職務、一つの社内認定で、実務課題と二人採点を試す。評価者は同じ例示成果物を採点し、点数が分かれた理由をルーブリックの項目ごとに話し合う。
校正で見るのは平均点の一致だけではない。重大エラーの判定、AI利用範囲の扱い、独創的だが基準外に見える解決策、合理的配慮の適用で判断が揺れないかを確認する。合意できない例は、評価者の問題ではなく基準が曖昧な証拠としてルーブリック改訂に使う。
認定後はOJTでの遂行と照合する。高得点者が実務でどの支援を必要としたか、低得点者が再挑戦後にどの行動を改善したかを記録する。試験と現場が一致しなければ、本人を責める前に課題条件と採点基準を見直す。
あわせて読みたい
- AIリスキリングの男女格差、機会配分から見直す
- AI学習コーチの品質管理、導入後モニタリングの設計
- 研修効果測定の自己報告バイアス:「役立った」を成果と誤認しない
出典
- OECD, Developing vocational education and training with artificial intelligence: https://www.oecd.org/content/dam/oecd/en/publications/reports/2026/06/developing-vocational-education-and-training-with-artificial-intelligence_b7efe1ae/e9f76b4e-en.pdf
- OECD, PISA 2029 Media and Artificial Intelligence Literacy Assessment Framework, First Draft: https://www.oecd.org/content/dam/oecd/en/about/projects/edu/the-pisa-2029-media-and-artificial-intelligence-%28mail%29-assessment-will-shed-light-on-whether-young-students-have-had-opportunities-to-learn-and-to-engage-proactively-and-critically-in-a-world-where-production%2C-participation%2C-and-social-networking-are-increasingly-mediated-by-digital-and-ai-tools-/PISA%202029%20MAIL%20Assessment%20Framework%20First%20Draft.pdf
- Council of the European Union, Conclusions on teachers and trainers in the era of artificial intelligence: https://eur-lex.europa.eu/eli/C/2026/2826/oj/eng/pdf