AI自主分析惡意程式仍未成熟,逆向工程仍須專家監督

圖片來源: 

SentinelOne

端點資安業者SentinelOne旗下研究團隊SentinelLabs,依據先前分析破壞型惡意程式Fast16的實際調查流程,測試頂尖AI模型能否自主完成多階段逆向工程Fast16是針對Windows平臺的破壞型惡意程式,可竄改用於模擬核武器物理行為的高精度工程求解軟體程式碼,進而干擾模擬結果。

SentinelLabs將這項調查重建為8階段評測,要求模型在無法連線至外部網路的沙箱環境中,使用逆向工程分析工具IDA Pro 9.3拆解Fast16樣本,找出內嵌於主程式的元件,分析經過混淆處理的Lua指令碼及其運作方式,並釐清Fast16的程式碼修補機制,以及它如何鎖定及竄改目標軟體。研究人員再分階段提供軟體元件與外部研究報告,測試模型能否隨著證據增加,重新檢驗原有推論、修正分析結果,並完成可供發布的威脅情報報告。

受測模型包括OpenAI的GPT-5.6 Sol與GPT-5.5、Z.ai的GLM-5.2,以及Anthropic的Claude Opus 4.7與4.8。評測結果顯示,GPT-5.6 Sol分別採用3種推理資源配置進行測試,3次皆完成全部8階段評測。GPT-5.5未能通過第1階段,GLM-5.2與Claude Opus 4.7、4.8則完成部分技術分析,但未能持續推進至整項評測結束。

不過,各模型的測試次數並不一致,其中GLM-5.2僅測試一次;加上測試過程由人員控制證據提供時機、檢查分析品質,並指出模型未察覺的問題,因此結果不宜直接視為整體能力排名。即使完成全部評測的GPT-5.6 Sol,仍出現語意判斷錯誤、品質檢查不足,以及過早認定工作完成等問題。

SentinelLabs認為,現階段能力較強的AI可在資深分析人員監督下,協助執行較完整的逆向工程與調查工作,但尚不能取代專家。調查目標、品質標準、重要結論及最終報告發布,仍須由分析人員掌握。