AIが見つけた欠陥は修正まで、仕事の成果は技能と分けて。MicrosoftとGoogleの研究

当ページのリンクには広告が含まれています。
コードを表示するモニターと、鉛筆で確認する書類・ノートを並べたAI調査と人の判断の概念画像

AIに任せた仕事を、何で評価すればよいのでしょうか。Microsoftは脆弱性の発見を修正へつなぐ運用を、GoogleはAIを使った成果と人の学習の違いを報告しました。安全なAI基盤の運用と、日々の仕事への取り入れ方を考える2件です。

目次
ベア三郎
家電製品アドバイザー(総合)
家電製品アドバイザーの資格を持つ家電の専門家。ほかにも複数の国家・ベンダー系IT資格を持つエンジニアの側面も。趣味のギター・ピアノは20年超のキャリアがある音楽大好きこだわり強めのクマです。

Microsoft FORGE:発見した脆弱性と、修正済みの件数を分けて見る

Microsoftは2026年10月7日、AIを使った脆弱性研究チーム「FORGE Lab」の活動を公式ブログで報告しました。オープンソースの23プロジェクトに社内検証済みの報告155件を提出し、執筆時点で14のプロジェクトまたは関連プロジェクト群の93件について、メンテナーの確認や受理が記録されています。

対象にはLinux、llama.cpp、vLLM、Node.jsなどが含まれます。ただし、提出・受理・修正・公開は別の段階です。155件すべてが修正済みという発表ではありません。出典:報告件数と公開状況。

Microsoftは、再現できる証拠、人によるレビュー、修正、回帰テストをつなぐ運用を重視しています。AI監査を導入する側には、警告の数とともに、再現できた割合や修正までの時間を見る視点が役立ちます。ローカルAI基盤を管理する人も、この報告だけで手元の特定バージョンが影響を受けるとは判断できないため、利用ソフトの個別の修正情報と照合する必要があります。出典:検証・修正の循環と評価指標。

Google:仕事の質と、AIなしの技能向上は同じではない

Google Researchは10月7日、特許業務に従事する弁護士の実験を公式ブログで解説しました。研究論文はNBERワーキングペーパー35720で、発行表示は2026年9月。10月7日は解説の公開日です。

実験は米国の知的財産分野の法律事務所11社・弁護士133人を対象にした、3か月のランダム化比較試験です。AIによる文書作成支援へのアクセスを割り当て、作成課題と、その後のAIを使わない判断力を、割り当てを知らない専門家が採点しました。出典:論文の要旨と実験条件。

AIにアクセスできる群では、作成課題の評価が10日後に0.34標準偏差、90日後に0.38標準偏差高くなりました。これは「品質が34%・38%上がった」という意味ではありません。90日後のAIなしの修正課題では、経験7年以上の層に改善が見られた一方、7年未満の層では平均的な改善が確認できませんでした。若手の得点は低い側と良い側に分かれ、全員の技能が落ちたという結果でもありません。出典:AI使用中とAIなしの評価結果。

日々の学習では、完成物の出来栄えに加えて、AIなしで誤りを見つけ、修正理由を説明できるかも確かめる方法が考えられます。これは本記事の提案で、特定の練習法の効果を実証したものではありません。研究自体も特許業務の限られた人数を3か月観察したもので、全職種や現在のAI製品へ同じ結果を当てはめることはできません。出典:研究の限界と今後の課題。

情報確認・本記事公開日:2026年10月8日(日本時間)。アイキャッチはAIによる調査と人による確認を表す生成概念画像で、実際の製品・研究システムの画面ではありません。

コメント

コメントする

目次