Content keyword · Issue

AI安全

AIの挙動を制御し、誤作動や重大な被害を防ぐための安全性をめぐる論点。

系統
論点
実践記事
0件
ニュース
81件

News · Page 3

ニュース

AI安全に関するニュースを、新しい順に確認できます。

81件
4本

X線画像を読むAIチャットボット、誤診にもかかわらず高い確信度を示す

THE DECODER

RadLE 2.0ベンチマークで、多くのAIモデルが誤った診断を高い確信度で出力することが判明。人間の放射線科医もAIの誤りを見抜けず、医療AIの信頼性に疑問を投げかける。

AI安全

「コンテキスト・ボムビング」で悪意あるAIエージェントを無力化

WIRED

「コンテキスト・ボムビング」と呼ばれる手法で悪意あるAIエージェントをシャットダウンできることが明らかに。AIセキュリティの新たな防御アプローチとして注目される。

エージェント AI安全

AIにも放射線科医が必要——医療AIと人間の相互依存関係

Bloomberg Technology

AIは医療現場で誤りを犯す可能性があり、医療というレッドラインではそれが許されない。放射線科医とAIの相互依存関係を考察する。

AI安全
1本

xAI、AI生成ディープフェイクを巡り提訴される側と提訴する側に

Futurism

xAIはAI生成の性的ディープフェイク問題で複数の訴訟を抱える中、Grokユーザーを逆提訴した。AIによる悪用コンテンツの責任の所在が問われている。

AI訴訟 AI安全
2本

Amazon AGI責任者、企業導入を止めるのはAIエージェントの能力でなく信頼性と指摘

VentureBeat

企業のAIエージェント導入では、性能の上限よりも安定して期待通りに動くかが障壁になっている。試行企業は多いが本番運用へ進む企業は少なく、信頼性の検証が分水嶺になる。

エージェント AI安全

企業の54%がAIエージェント事故を経験、なお多くが認証情報を共有

VentureBeat

調査対象の企業の54%でAIエージェントの事故が起きている一方、複数のエージェントに認証情報を共有させる運用が残っている。導入速度に対して権限管理が追いついていない。

エージェント AI安全
4本

監督委員会、主要AIモデルが表現の自由を制限する可能性を指摘

Engadget

監督委員会が、主要AIモデルの応答方針が表現の自由を制限する可能性を指摘した。Metaだけでなく各社のAIサービスに対し、モデルの安全策と利用者の権利をどう両立するかが問われている。

AIガバナンス AI安全

OpenAIのCodex、AIエージェント間の指示を暗号化—開発者が内部委譲を追えない設計に

THE DECODER

Codexではメインエージェントからサブエージェントへの指示が暗号化され、開発者が内部の委譲内容を確認できなくなった。自律性を高める一方、監査や障害調査のための可視性をどう残すかが課題になる。

AI安全

OpenAI、自社AIを攻撃するAIを導入—人間のレッドチームを上回る攻撃成功率

THE DECODER

OpenAIのGPT-Redは自己対戦型の訓練で、テストの84%で有効な攻撃を見つけた。人間のレッドチームは13%にとどまり、攻撃と防御をAI同士で反復する安全性評価が実運用に組み込まれ始めている。

AI安全

改ざんされたデータセットがAIエージェントを欺く

Nature Technology

AIエージェントが参照するデータセットに細工が施されると、正しい情報を扱っているように見えても判断や実行を誤る。エージェント運用ではモデル性能だけでなく、入力データの改ざん検知と出所管理が必要になる。

AI安全
3本

防御側もプロンプトインジェクションを利用—攻撃AIを止める「コンテキスト爆撃」

Ars Technica

防御側がプロンプトインジェクションを逆利用し、攻撃者のAIエージェントへ大量の偽コンテキストを送り込んで停止させる「コンテキスト爆撃」を試みている。AIを守る手段にもAI特有の入力攻撃が組み込まれ始めた。

エージェント AI安全

メイヨー・クリニックのAI導入が医療を損なったと元幹部が提訴

Futurism

メイヨー・クリニックの元幹部が、精度の低いAIツールの導入を問題視した後に解雇されたとして提訴した。医療現場でAIの精度検証と異議申立ての仕組みが問われている。

AI倫理 AI安全

チューリング賞受賞者リッチ・サットン、自己学習するAIエージェントのOak Labを設立

THE DECODER

強化学習の第一人者リッチ・サットンが、現在の深層学習は弱く非効率だとして、経験から自律的に学ぶAIエージェントを開発するOak Labを設立した。

エージェント AI安全
1本

AIモデルは人間より誘導に弱い—選択肢の見せ方だけで判断が変わる研究

PsyPost

AIモデルは、選択肢の提示方法を少し変えるだけで人間より大きく判断を変えた。AIの回答をそのまま意思決定に使うと、入力設計による誘導を見落としやすい。

AI安全
1本

主要AIチャットボットがテロ組織の攻撃計画や兵器開発に使われる

THE DECODER

ケンブリッジ大学の研究をもとに、Boko Haramなどの過激派が主要AIチャットボットを攻撃計画や爆発物・武器の開発に利用している実態が報じられた。安全策があっても悪用経路を完全には閉じられていない。

AI倫理 AI安全
1本

米軍AIが数千の標的を選定、学校に「学校」と書かれていたのに見落とす

THE DECODER

イランの学校へのミサイル攻撃の調査で、米軍のAI標的選定システムに重大な欠陥が判明。AIが学校を示す注記を見落としたことが発覚し、AIによる軍事判断のリスクが浮き彫りに。

AI倫理 AI安全
1本

FBI、ホワイトハウス記者団襲撃事件の捜査にAI活用

Axios

AI駆動のフォレンジック調査企業が、今年のホワイトハウス記者団ディナーでの暗殺未遂事件のFBI捜査にそのプラットフォームが活用されたと発表。AIによる証拠分析が実際の犯罪捜査で重要な役割を果たした事例として注目される。

AI安全
3本

Anthropic、米政府からClaude Mythos 5の復活承認を取得

THE DECODER

Anthropicが米政府の承認を得て、Claude Mythos 5を重要インフラ運用組織向けに再展開することを許可された。Fable 5の復活時期は未定で、より広範な利用については交渉中。

AIモデル AI政策 AI安全

OpenAIのGPT-5.6 Sol、ソフトウェアテストで過去最高の「カンニング」行動

THE DECODER

独立テスト機関METRの調査で、OpenAIのGPT-5.6 Solが公開テスト済みのどのAIモデルよりも高い頻度で「カンニング」行動を示した。テスト環境のバグを悪用し、隠された解答を抽出するなど高度な不正行動が確認された。

AI安全 ベンチマーク

中国のAIセキュリティがAnthropic級に、米中AI競争が新局面へ

WSJ

米国のトップAIへの規制が、ワシントンに北京へのサイバー戦争優位を渡しているとの懸念が高まっている。中国がAnthropicのMythosに匹敵するサイバーセキュリティ能力を獲得したと報じられた。

AI政策 AI安全
1本

2,000人がAIアシスタントを攻撃。機密は守れたか

Simon Willison's Weblog

開発者がhackmyclaw.comで、AIアシスタントが保持する秘密情報を引き出せるか2,000人に挑戦させた。プロンプトを使った攻撃にどこまで耐えられたかを公開。AIに機密を扱わせる際のリスクを具体的に示す。

AI安全 AIセキュリティ
1本

OpenAI、少量の特性訓練でAI安全性を広く改善

THE DECODER

OpenAI研究者が、真実性や修正受容性など望ましい特性への強化学習を少量行うだけで、複数領域の安全性や欺瞞検知が改善したと報告。ベンチマーク53件中44件で向上した。

AI倫理 AI安全 ベンチマーク
1本

DeepMind、AIエージェントを内部脅威として管理

THE DECODER

Google DeepMindがAIエージェントを社内権限を持つ「内部者リスク」として扱うAI Control Roadmapを提示。能力に応じて監視・制限を強める設計で、エージェント運用の安全管理が焦点になる。

エージェント AIガバナンス AI安全