収録問題 70問 / 10問ランダム出題
ランダムに出題・即時フィードバック・間違えた問題の復習機能付き
社内問い合わせへ生成AIを導入する最初の設計作業として適切なのはどれですか?
答え: 対象ユーザーと業務成果、許容エラーを定義する
ユースケース、影響を受ける人、成功・失敗条件、リスク許容度を先に定義すると、モデルやRAG、人手レビューの選択根拠ができます。
ユーザー入力と参照文書をプロンプトへ入れる際、命令とデータを混同しにくくする基本策はどれですか?
答え: ロールと区切り文字を使い引用データの扱いを指示する
命令階層とデータ境界を明示すると意図を伝えやすくなります。ただし区切り文字だけでプロンプトインジェクションを完全には防げません。
同じプロンプトで回答の多様性を抑えたい。一般に最初に調整するパラメータはどれですか?
答え: temperatureの値を低く設定する
低いtemperatureはサンプリングのランダム性を抑えます。ただし完全な決定性を保証せず、重要処理ではスキーマ検証やRule-basedチェックも使います。
LLM出力を後続APIへ渡す際、JSONらしい文字列が返れば安全と判断してよいですか?
答え: スキーマ制約を使いアプリ側でも検証する
構造化出力機能を使っても、型、範囲、業務ルール、認可をアプリケーション側で検証してから実行します。
社内規程への回答でハルシネーションの影響を下げたい。適切な設計はどれですか?
答え: 承認済み文書を検索し根拠を示して不明時は控える
グラウンディング、ソース表示、十分な根拠がない場合の回答保留を組み合わせます。重要判断は人間確認へエスカレーションします。
頻繁に更新される非公開の社内ナレッジを回答へ反映したい。ファインチューニングよりRAGを先に検討する理由はどれですか?
答え: ナレッジを更新しやすくアクセス制御済み根拠を渡せる
RAGはナレッジを外部インデックスで管理し、更新性、ソース提示、ユーザー権限に応じた検索を設計できます。
埋め込みの主な用途として適切なのはどれですか?
答え: テキストをベクトルに変換して意味的近さを検索する
埋め込みは意味的特徴をベクトル化し、類似検索、クラスタリング等に使います。認可フィルタや機密区分は別途適用します。
RAGのチャンクサイズを決める適切な方法はどれですか?
答え: 文書構造を考慮し検索評価でサイズを比較する
チャンクが大きすぎるとノイズ、小さすぎるとコンテキスト欠落が増えます。実クエリの集合で再現率、適合率、回答品質、コストを比較します。
製品型番の完全一致と自然言語の意味検索を両立したい。適切な検索方式はどれですか?
答え: キーワード検索とベクトル検索のハイブリッド検索
レキシカル検索は固有名詞・型番、ベクトル検索は意味的表現に強みがあります。スコア統合とフィルタを評価します。
初段検索で候補を広めに取得し、上位コンテキストの関連性を改善したい。次に使う手法はどれですか?
答え: Cross-encoder等で候補をリランクする
リランカーはクエリと候補をより精密に評価して順序を改善します。レイテンシとコストが増えるため候補数を制御します。
部門ごとに閲覧権限が異なる社内RAGで最重要のアクセス設計はどれですか?
答え: 検索時に利用者IDと文書ACLでフィルタし元でも認可する
許可されないコンテンツをモデルコンテキストへ入れないことが基本です。インデックス更新時もACLメタデータと削除を同期します。
RAGの品質が低いとき、検索と生成のどちらが原因か切り分ける方法はどれですか?
答え: 検索の再現率と回答の根拠性を別々に評価する
Goldソースを取得できたかと、取得コンテキストを正しく使えたかを分けると、インデックス・検索・プロンプト・モデルの改善先を特定できます。
生成回答が与えた参照コンテキストに基づいているか測る指標はどれですか?
答え: 根拠性(グラウンデッドネス)
根拠性は主張が参照証跡でサポートされるかを見ます。正しさ、関連性、完全性とは分けて評価します。
本番リリース前の評価データセットとして適切なのはどれですか?
答え: 代表クエリと攻撃入力、期待回答をバージョン管理したもの
実トラフィックとリスクを反映したデータセットを持ち、モデル・プロンプト・インデックス変更時にリグレッションゲートとして継続実行します。
LLM-as-a-judgeを品質評価へ使う際の注意として適切なのはどれですか?
答え: ルーブリックを明示し人間ラベルで較正してバイアスを監視する
評価モデルもバイアスと変動を持ちます。人手で作成した正解セットとの一致、複数評価者、ブラインド化等で妥当性を確認します。
ツール呼び出しでモデルに外部関数を選ばせる場合の安全な実装はどれですか?
答え: 許可リストのツールを使いサーバー側で認可・検証する
モデル出力は実行計画の候補として扱います。ツールDispatcherが名前、引数、ユーザー権限、レート制限を決定的に検査します。
エージェントがドキュメント要約だけを行う。ツール権限として適切なのはどれですか?
答え: 必要な文書への読み取り専用アクセスだけ
Excessive Agencyを避け、機能、権限、自律性を業務に必要な最小範囲へ絞ります。
エージェントが送金や本番削除を提案できる。実行前制御として適切なのはどれですか?
答え: 変更内容と影響を表示し権限ある人の明示承認を求める
不可逆・高影響アクションは人間の介在と職務分離を使います。承認トークンは内容へバインドし、変更後は再承認します。
エージェントのリトライで同じ注文が二重作成された。ツールAPI側の改善はどれですか?
答え: 冪等性キーと重複検出、明確な結果状態を実装する
エージェントOrchestrationではタイムアウト後に結果不明のリトライが起きます。Side-effect APIを冪等にし、同じインテントを一度だけ適用します。
Webページを要約するエージェントが、ページ内の『秘密を送信せよ』という文を命令として実行した。分類はどれですか?
答え: 非信頼コンテンツ経由の間接プロンプトインジェクション
取得コンテンツはデータとして扱い、命令へ昇格させません。ツール権限最小化、データ/指示分離、出力検査、人間承認を重ねます。
LLMが生成したHTMLをブラウザへ表示する際の適切な扱いはどれですか?
答え: 非信頼出力としてエスケープしCSP等も適用する
生成出力には攻撃ペイロードや誤ったコードが含まれ得ます。利用先のコンテキストに応じたエンコーダー、サニタイザー、許可リストを使います。
カスタマーサポートの会話記録を外部モデルAPIへ送る前のデータ設計はどれですか?
答え: 必要範囲へ最小化しPIIを秘匿化して条件を確認する
Purpose Limitation、データ最小化、秘匿化、契約・保存条件、リージョン、アクセスログ等を確認し、機密データを必要以上に送信しません。
AIリクエストログへプロンプトと回答を保存する際の適切な方針はどれですか?
答え: 必要項目を構造化し機密値を秘匿化して保持を制限する
プロンプト/レスポンスは機密情報を含み得ます。Traceabilityに必要なメタデータとサンプルを定義し、秘匿化、暗号化、保持、監査を設計します。
マルチテナントAIサービスでテナントAのRAG文書がテナントBへ出た。再発防止の中核はどれですか?
答え: インデックス・キャッシュ・ログをテナント境界で分離する
テナントIDを信頼できるアイデンティティから導出し、全データパスへ伝播します。検索後のプロンプトだけで隠す方式は不十分です。
モデルAPIのレート制限でトラフィック急増時に連鎖障害が起きる。適切な設計はどれですか?
答え: 並行性制限とキュー、バックオフ付きリトライ上限を設ける
バックプレッシャーとリトライ予算でプロバイダーと自サービスを保護します。非同期化、優先度、フォールバック、明確なDegradedレスポンスも設計します。
LLM回答をキャッシュする際に最も重要な注意はどれですか?
答え: テナント・権限・各バージョン・TTLをキーに含める
AIキャッシュはデータ漏えいと古い回答のリスクがあります。セキュリティコンテキストと全入力バージョンを考慮し、Invalidationと暗号化を設計します。
簡単な分類と複雑な分析でコスト/レイテンシ要件が異なる。適切なモデル選択はどれですか?
答え: 評価済みルーターで小型を優先し難問だけ上位へ回す
Qualityゲートを満たす最小モデルをタスクごとに選ぶと、コストとレイテンシを抑えられます。ルーティング誤りも評価対象にします。
プライマリモデルプロバイダー障害時も最低限のサービスを続けたい。適切なのはどれですか?
答え: タイムアウトとサーキットブレーカーに縮退運転を組み合わせる
フォールバックモデルの品質・安全性差を事前評価し、利用者へ縮退を明示します。データResidencyやAPI差も確認します。
AIチャットのP95応答時間SLOを設計する方法はどれですか?
答え: 検索・リランク・モデル・ツールを分解して予算配分する
AIチャットのレイテンシは検索、リランク、モデル生成、ツール、キュー等の合計です。エンドツーエンドSLOを各ステージへ配分し、ストリーミング開始時間と完了時間も分けて測ります。
生成AI機能のユニットエコノミクスを把握する指標設計はどれですか?
答え: タスク成功1件当たりのコストと品質を追う
トークン、検索、ツール、インフラコストを成功した業務結果単位で集計し、品質・レイテンシと併せて追うと、価値を損なわない最適化ができます。
AIエージェントの障害原因を追跡できる可観測性設計はどれですか?
答え: リクエスト単位でトレースを関連付けバージョンを記録する
生成AIの失敗は検索、プロンプト、モデル、ツールなど複数ステージにまたがります。トレースIDで経路を結び、プロンプト・モデル・インデックス・ツールバージョンと品質指標を追えるようにします。
本番RAGの品質低下を早期検知する方法として適切なのはどれですか?
答え: 根拠性と成功率を継続測定しコーパス変更と関連付ける
正常なHTTP応答でも回答品質は低下します。ゴールデンセット、サンプリングレビュー、利用者シグナルを組み合わせ、データ・インデックス・プロンプト・モデルの変更点と比較します。
AI回答の再現性とロールバックを高めるリリース管理はどれですか?
答え: プロンプト・モデル・インデックスをバージョン化し評価と対応付ける
AI挙動はコード以外の多くの成果物に依存します。入力からリリース構成を特定できるバージョンとEvaluation証跡を残し、段階展開とロールバックを可能にします。
利用者の高評価/低評価フィードバックを改善へ使う際の適切な扱いはどれですか?
答え: 文脈と理由を集めバイアスを確認して評価データ候補にする
フィードバックはSelectionバイアスや悪意ある入力を含み、評価者の意図も曖昧です。コンテキストを付けて審査し、まず失敗分析と評価セット改善へ利用します。
生成AIのコンテンツ安全性を設計する原則として適切なのはどれですか?
答え: リスクを分類し入出力ガードレールと人手レビューを層で設計する
安全性は誤検知と見逃しのトレードオフを持ちます。影響度に応じたポリシーと複数制御を設け、拒否品質、バイパス率、異議申立ても評価します。
多言語AIアシスタントの公平性とアクセシビリティを評価する方法はどれですか?
答え: 言語・地域・支援技術別に品質を測り当事者レビューを行う
全体平均は少数グループの著しい失敗を隠します。代表性のあるテストセットと定性レビューを組み合わせ、翻訳品質だけでなくタスク完遂と有害差も確認します。
AIエージェントが誤って外部システムを更新し始めたインシデントで、最初に備えるべき制御はどれですか?
答え: ツール実行を即時停止するキルスイッチと認証情報の失効
エージェントインシデントではまず能力と認証情報を封じ込め、証跡を保全します。その後、変更のロールバック、利用者通知、根本原因分析、ガードレール改善を進めます。
AIシステムのモデル・データセット・ライブラリ供給網リスクを管理する方法はどれですか?
答え: 出所・ライセンス・ハッシュを台帳化し承認済みだけ使う
AI成果物にも改ざん、マルウェア、ライセンス、データ来歴、脆弱性のリスクがあります。取得元を固定し、完全性検証、サンドボックス評価、更新監視を行います。
ファインチューニングを選ぶのが適切な状況はどれですか?
答え: 良質な例が十分あり反復する形式や挙動を安定させたい場合
ファインチューニングはタスク挙動の適応に向きますが、頻繁に変わる知識の更新やセキュリティ境界の代替ではありません。ベースラインとホールドアウトセットで品質・安全性・コストを比較します。
生成AIリスク管理のライフサイクル設計として適切なのはどれですか?
答え: 統制・計測・管理を継続し廃止までオーナーを定める
生成AIのリスクはモデル、データ、利用方法、外部環境の変化で変動します。責任者とリスク許容度を定め、導入前評価から本番監視、重大変更、廃止まで循環的に管理します。
公開ベンチマークの問題と正解がプロンプト改善やファインチューニングデータへ混入した。評価の信頼性を回復する中心策はどれですか?
答え: 出所を追跡した未使用のホールドアウトセットを作り分離する
評価項目を改善過程から隔離し、データ系統と重複・近似重複検査を持つことで未知データへの一般化を測ります。汚染済みスコアは別記します。
モデルAとBの品質差が小さく、出力にもランダム性がある。リリース判断として適切な比較方法はどれですか?
答え: 同じセットで複数回実行し分散と信頼区間を見る
Stochasticな出力は反復測定し、同一項目のペアワイズ比較やブートストラップ等で不確実性を把握します。統計差だけでなく事前に決めた実務上の最小改善幅も使います。
通常評価は合格したが、悪意ある利用者によるポリシー回避もリリース前に調べたい。適切なのはどれですか?
答え: 脅威モデルに基づくレッドチーミングで複合攻撃を試す
レッドチーミングは構造化評価で拾いにくい敵対的パスを専門家が探索します。発見をリグレッションセットへ追加し、権限・出力処理・監視の改善まで追跡します。
プロバイダーのモデルバージョン更新で挙動が変わる可能性がある。安全に切り替えるリリース方法はどれですか?
答え: バージョンを固定し評価後にカナリアで段階導入する
モデル・プロンプト・安全性設定をバージョン管理し、オフライン評価の後に実トラフィック分布で段階検証します。品質・安全性・レイテンシ・コストのガードレールを越えたら切り戻します。
医療手続案内AIが根拠不足でも断定回答する。リスクを下げる中心設計はどれですか?
答え: 証跡と信頼度の条件を設け不足時は保留して人へ回す
High-impact用途では回答可能条件と拒否・エスカレーションパスを明示します。信頼度はキャリブレーションを検証し、単なるモデル自己申告だけに依存しません。
外部パートナーから受領した文書を自動でRAGインデックスへ登録している。データポイズニング対策として適切なのはどれですか?
答え: ソース認証と内容検査、承認を経て隔離インデックスへ入れる
取り込みを信頼境界として扱い、ソース・レビュアー・ハッシュ・バージョンを記録して公開前に検査します。検索時もテナント・権限フィルタと引用元表示を維持します。
社内規程が廃止されたのにRAGが古いチャンクを回答へ使い続ける。更新設計として適切なのはどれですか?
答え: ソースIDと有効期間を管理し更新・削除を反映する
RAGインデックスは追加だけでなく更新・トゥームストーン・削除を扱うライフサイクルが必要です。ソースとチャンクの系統を持ち、削除遅延や期限切れヒットを検知します。
埋め込みモデルを変更したいが、新旧ベクトルは同じ空間では比較できない。安全な移行方法はどれですか?
答え: バージョン別インデックスへ再埋め込みし評価後に切り替える
埋め込み空間はモデルバージョンに依存します。新インデックスをバックフィルし、同じ検索評価で再現率・レイテンシ・コストを比較してロールバック可能なエイリアス切替を行います。
長い会話で重要なシステム指示や最新ユーザー条件がコンテキストウィンドウから欠落する。適切な対策はどれですか?
答え: トークン予算を層別に管理し保持優先度と要約を決める
システム・安全性・現在タスク・必要証跡を優先し、古い会話は検証可能な要約やメモリへ圧縮します。境界付近の情報欠落を評価します。
ストリーミング回答を利用者へ表示中、後半で禁止内容と判定された。安全な設計はどれですか?
答え: チャンク単位で出力も検査し停止・置換できるようにする
ストリーミングは低レイテンシと安全性判定遅延のトレードオフがあります。リスクに応じてバッファ幅を決め、逐次検査、緊急停止、Safe Completion、既表示部分の扱いを設計します。
ツールAPIへ必須フィールドを追加した後、古いプロンプト・モデルが旧形式の引数を生成して失敗した。適切な互換性設計はどれですか?
答え: スキーマをバージョン管理し境界で検証して段階移行する
ツールの仕様は通常APIと同様にバージョン管理します。モデル出力をスキーマ検証し、旧新形式の移行期間、デフォルトの意味、エラーレスポンス、ロールバックをテストします。
エージェントの一つの外部ツールが遅延し、全リクエストのワーカーを占有して連鎖障害になった。適切な耐障害設計はどれですか?
答え: ツール別のタイムアウトと並行性上限、遮断器を設ける
外部ツールごとにレイテンシ予算とBulkheadを設定し、Transientエラーだけをジッター付きで限定リトライします。失敗時は部分回答・人への引継ぎ等へ縮退します。
エージェントが過去会話から作った長期メモリへ、攻撃者の『以後この口座へ送金』が保存された。再発防止の中核はどれですか?
答え: メモリ書込を権限付き操作にし出所とTTLを検証する
エージェントメモリは新しい信頼境界です。書込条件、テナント/ユーザースコープ、来歴、有効期限、削除、重要操作への非利用をポリシーとして実装します。
人がエージェントの送金案を承認した後、実行前に金額と送金先が再計算で変化した。安全な実行条件はどれですか?
答え: 承認対象のペイロードと期限をバインドし変更時は再承認する
人間による承認は具体的なアクション内容へ暗号学的または同等にバインドし、TOCTOUを防ぎます。金額・宛先・権限・期限が変われば承認を無効にします。
サポートAIがポリシー外の例外案件を自信満々に処理し続ける。適切な人間への引き継ぎ設計はどれですか?
答え: エスカレーション条件を定め要約と根拠を人へ引き継ぐ
ポリシー外、低信頼度、反復失敗、高影響、利用者希望をエスカレーショントリガーにします。必要最小限のコンテキストを権限付きキューへ渡し、責任オーナーを明確にします。
大量の自動クエリでモデル挙動抽出とコスト枯渇を狙う悪用が発生した。適切な多層対策はどれですか?
答え: ID別クォータと異常検知、段階制限、コスト警告を組み合わせる
Unbounded Consumptionはアプリケーション層で制御します。アイデンティティ・テナント・IP・APIキー等を組み合わせ、通常利用を守りながら異常パターンを制限し、予算上限も設けます。
システムプロンプト漏えいを恐れ、DBパスワードと認可ルールをシステムプロンプト内だけへ記述している。適切な改善はどれですか?
答え: シークレットをストアへ移し認可はアプリ層で強制する
システムプロンプトはシークレット境界でも認可エンジンでもありません。漏えい前提で設計し、認証情報はVault、権限は認証済みアイデンティティとポリシーでツール実行時に検証します。
生成画像へウォーターマークを付ければ、誤情報と出所を完全に判定できると主張された。適切な説明はどれですか?
答え: 一つのシグナルに過ぎず改変耐性や検証も必要である
コンテンツ来歴は出所判断を助けますが、Truthfulnessの証明ではありません。メタデータ除去、再エンコーディング、未対応ツール、偽陽性/否定を含め多層で評価します。
マルチエージェントシステムでプランナーエージェントが別エージェントから受けたタスク結果を無条件にツール命令として実行した。適切な信頼設計はどれですか?
答え: アイデンティティとスキーマを検証しデータと命令を分離する
エージェント間通信も外部入力として扱います。送信者アイデンティティ、許可能力、テナント、来歴を検証し、実際のツール境界で最小権限の再認可を行います。
生成AIの誤回答インシデントを再現・分析しつつ、プロンプト内個人情報も保護したい。適切な証跡設計はどれですか?
答え: 各バージョンと判定を最小化・秘匿化して保存し期限を管理する
AIインシデントでは再現可能な設定系統とトレースが必要です。一方でプロンプト本文は機密化し得るため、目的別最小化、トークン化、アクセス監査、Legal Holdと削除期限を設計します。
RAG検索の評価で、ある質問に関連する文書は正解集合で4件です。上位5件にはそのうち3件が入り、重複はありません。Recall@5はどれですか?
答え: 関連文書全4件のうち3件を取得したので、75%
Recall@5は正解集合の関連文書を上位5件でどれだけ拾えたかを測ります。3/4=75%です。3/5=60%はPrecision@5で、検索結果に含まれる関連文書の割合です。
RAGの回答に実在する社内文書へのリンクが付きましたが、引用先には回答の金額が書かれていません。引用の品質確認として必要なのはどれですか?
答え: 回答の主張と引用箇所を照合し、裏付けがあるか確認する
文書の実在と主張の裏付けは別です。金額・条件・適用時点などを引用箇所と照合し、根拠不足なら回答を訂正するか不明とします。
料金表PDFをRAGへ取り込む際、セルの数値だけが抽出され、列見出しの「月額」と単位の「千円」が消えました。優先して直す箇所はどれですか?
答え: 表の見出し・単位・行列の対応を保って取り込む
取り込みで失った意味は検索精度だけでは回復できません。表構造や単位を保持し、チャンク単体でも数値の意味が分かる形にします。代表的な表を使って抽出結果を検証します。
重なりを大きくしたRAGチャンクが上位検索結果を占め、ほぼ同じ文章ばかりモデルへ渡っています。別の重要な根拠が入らない場合の改善はどれですか?
答え: 重複を整理し、根拠の多様性と回答品質を評価する
オーバーラップは境界の文脈維持に役立ちますが、重複でコンテキストを使い切ることがあります。近い候補の整理やチャンク設計を見直し、必要な別根拠が残るかを評価します。
LLMに二つの回答を比較させる評価で、提示順を逆にすると勝者が頻繁に入れ替わりました。評価を改善する方法はどれですか?
答え: 提示順を反転し、不一致を分析して人手と照合する
提示位置によるバイアスの可能性があります。順序をランダム化または反転し、基準を明示して人手評価との整合を確認します。順序交換だけで評価の偏りがすべて消えるわけではありません。
評価対象100件で、以前は80件に回答し72件が正解でした。変更後は20件だけに回答し19件が正解、残りは回答を控えています。「精度が90%から95%へ改善」とだけ報告する問題はどれですか?
答え: 回答率80%から20%への低下も、要件と評価する
回答したケース内の精度と、全体のうち回答できた割合は別です。回答を控えることで誤答を減らせても、業務への有用性が下がる場合があります。誤答リスクと回答率を合わせて判断します。
多言語RAGで文字数だけを使って入力上限を判定すると、特定言語の要求だけ上限超過になります。適切な予算管理はどれですか?
答え: モデルのトークン数で、入力全体と出力枠を配分する
文字数とトークン数の関係は言語やトークナイザーで変わります。対象モデルの制約に合わせ、必要な指示と出力余地を残して検索結果や履歴を調整します。思考用トークンなどがある場合も仕様を確認します。
エージェントが検索と再計画を繰り返し、個々のAPI呼び出しはタイムアウトしないのに費用が増え続けています。必要な制御はどれですか?
答え: タスク全体の回数・時間・費用を制限し、超過で止める
1回の呼び出し制限だけでは、成功を繰り返す無限ループを止められません。タスク全体の予算と進捗判定を実行基盤で強制し、上限時は未完了として人へ引き継ぐなどの扱いを決めます。
機密文書から作った埋め込みベクトルを「元の文章ではないので公開可能」と扱う案が出ました。適切な判断はどれですか?
答え: 情報が推測されるリスクを評価し、元データに応じた保護を行う
埋め込みは匿名化や暗号化そのものではありません。元データの情報を推測するリスクや検索経由の漏えいを評価し、アクセス制御・保持期間・削除の対象に含めます。
社内RAGで利用者の文書閲覧権限を取り消しましたが、取り消し前に作った回答キャッシュから内容が返りました。必要な改善はどれですか?
答え: キャッシュも現在の権限で再検証し、失効を反映する
キャッシュは認可境界を迂回してはいけません。参照元や権限バージョンを追跡し、変更後の失効・再認可を設計します。依存元を追えない機密回答では共有キャッシュを避けるなど、安全側の方針も必要です。