AIに任せた仕事を、何で評価すればよいのでしょうか。Microsoftは脆弱性の発見を修正へつなぐ運用を、GoogleはAIを使った成果と人の学習の違いを報告しました。安全なAI基盤の運用と、日々の仕事への取り入れ方を考える2件です。
Microsoft FORGE:発見した脆弱性と、修正済みの件数を分けて見る
Microsoftは2026年10月7日、AIを使った脆弱性研究チーム「FORGE Lab」の活動を公式ブログで報告しました。オープンソースの23プロジェクトに社内検証済みの報告155件を提出し、執筆時点で14のプロジェクトまたは関連プロジェクト群の93件について、メンテナーの確認や受理が記録されています。
対象にはLinux、llama.cpp、vLLM、Node.jsなどが含まれます。ただし、提出・受理・修正・公開は別の段階です。155件すべてが修正済みという発表ではありません。出典:報告件数と公開状況。
Microsoftは、再現できる証拠、人によるレビュー、修正、回帰テストをつなぐ運用を重視しています。AI監査を導入する側には、警告の数とともに、再現できた割合や修正までの時間を見る視点が役立ちます。ローカルAI基盤を管理する人も、この報告だけで手元の特定バージョンが影響を受けるとは判断できないため、利用ソフトの個別の修正情報と照合する必要があります。出典:検証・修正の循環と評価指標。
Google:仕事の質と、AIなしの技能向上は同じではない
Google Researchは10月7日、特許業務に従事する弁護士の実験を公式ブログで解説しました。研究論文はNBERワーキングペーパー35720で、発行表示は2026年9月。10月7日は解説の公開日です。
実験は米国の知的財産分野の法律事務所11社・弁護士133人を対象にした、3か月のランダム化比較試験です。AIによる文書作成支援へのアクセスを割り当て、作成課題と、その後のAIを使わない判断力を、割り当てを知らない専門家が採点しました。出典:論文の要旨と実験条件。
AIにアクセスできる群では、作成課題の評価が10日後に0.34標準偏差、90日後に0.38標準偏差高くなりました。これは「品質が34%・38%上がった」という意味ではありません。90日後のAIなしの修正課題では、経験7年以上の層に改善が見られた一方、7年未満の層では平均的な改善が確認できませんでした。若手の得点は低い側と良い側に分かれ、全員の技能が落ちたという結果でもありません。出典:AI使用中とAIなしの評価結果。
日々の学習では、完成物の出来栄えに加えて、AIなしで誤りを見つけ、修正理由を説明できるかも確かめる方法が考えられます。これは本記事の提案で、特定の練習法の効果を実証したものではありません。研究自体も特許業務の限られた人数を3か月観察したもので、全職種や現在のAI製品へ同じ結果を当てはめることはできません。出典:研究の限界と今後の課題。
情報確認・本記事公開日:2026年10月8日(日本時間)。アイキャッチはAIによる調査と人による確認を表す生成概念画像で、実際の製品・研究システムの画面ではありません。


コメント