當 AI 模型不再只是被動回應,而是主動執行任務、呼叫工具、甚至操控系統時,傳統的安全邊界已徹底失效。本場議程將從攻守兩端,深入探討現代 AI 系統的安全挑戰:一方面,我們如何系統性地評估模型的安全性——不只是輸出過濾,而是從架構層面理解其弱點;另一方面,真實的攻擊者如何繞過護欄、突破沙箱,甚至利用模型本身的推理能力發動攻擊。透過實際案例與技術分析,本議程將呈現 AI 安全防禦的真實樣貌,以及在這場非對稱戰爭中,守方究竟能做什麼。
RAG(Retrieval-Augmented Generation)已成為企業導入 AI 的主流架構,但當外部文件進入模型的上下文視窗,攻擊面也隨之擴大。本場議程將介紹一種新型的「注意力偏移」攻擊手法——攻擊者透過精心設計的文件內容,操縱模型的注意力分配,使其忽略正常指令、洩露敏感資訊,甚至在不被察覺的情況下改變輸出行為。我們將展示實際的攻擊範例、分析其背後的機制,並探討現有防禦手段的有效性與侷限。
當 AI 系統開始參與企業的關鍵決策,傳統的 GRC(治理、風險、合規)框架還夠用嗎?本場議程將從實務角度切入,探討企業在導入 AI 系統時所面臨的治理挑戰:如何定義 AI 系統的風險邊界?現有的合規框架(如 ISO 42001、NIST AI RMF)能否直接套用?當模型出錯,責任該如何歸屬?我們將分享奧義智慧在內部 AI 治理上的實踐經驗,以及在協助企業客戶建立 AI GRC 機制時遇到的真實問題與解法。
#Security AI
矛盾大對決:全副武裝的 AI Agent 對決極限混淆惡意程式
☆☆☆☆ | Black Hat USA 2025 | 奧義智慧資深資安研究員 趙偉捷
惡意程式分析向來是資安領域中最耗時、最仰賴人工判讀的工作之一。當混淆技術不斷演進,傳統的靜態分析工具越來越難招架。本場議程將展示我們如何打造一個以 AI Agent 為核心的自動化分析系統,讓它面對真實世界中高度混淆的惡意程式樣本——包括多層加殼、反除錯、動態解密等手段——並嘗試在不依賴人工的情況下完成分析與判定。我們將展示成功與失敗的案例,誠實討論 AI 在這場對決中的上限與盲點。