Yelp
重點新聞(0724~0730)
機器學習 模型訓練 Yelp
Yelp打造統一模型訓練平臺,AI團隊可以少寫一點「膠水程式」
美國知名點評平臺Yelp推出一套框架Training Orchestrator,可統一不同機器學習團隊的模型訓練流程。過去,每個團隊都得各自撰寫Spark訓練腳本和通知系統等「膠水程式」 ,不只重複造輪子,設定也不一致;即使只是小改程式,還是得啟動Spark叢集,才知道哪裡出錯,也拖慢測試速度。
新版框架把這些共通工作抽離,開發者只需描述模型訓練流程與設定,其餘像是執行順序、環境切換、監控與紀錄,都交給系統自動完成。開發者以Pydantic設定訓練步驟、輸入輸出與相依關係,系統再自動組成有向無環圖(DAG),依序執行資料準備、模型訓練等工作。相同的步驟可直接在本機、Jupyter或正式Spark環境執行,也能先檢查設定錯誤、替單一步驟撰寫測試,避免跑了數小時才失敗。
每次訓練的完整設定會自動存入MLflow,方便重新執行、追蹤和部署,Slack通知等功能也改由共用設定啟用。接下來,Yelp還計畫加入模型評估、版本比較、可解釋性及資料血緣追蹤。(詳全文)

Gemini Spark AI Agent Google
Google開放Gemini Spark給臺灣用戶,24小時AI代理正式上線
Google宣布,全天候AI代理Gemini Spark正式開放臺灣Google AI Pro用戶使用。有別於傳統聊天機器人,Spark可在背景持續執行多步驟任務,即使使用者離開電腦或手機,也能在雲端繼續完成工作,把繁瑣流程交給AI處理。
Gemini Spark還能編輯Google Workspace文件,並串接Google Keep、Google Tasks,以及Canva、Dropbox等第三方服務,也支援MCP,可連接更多外部工具。Google也給出一些應用範例,比如「只要收到航班或飯店確認信,就自動把資訊存進『峇里島行程』的試算表」、「閱讀我過去的 50 封電子郵件並歸納出寫作風格指南。將此設為名為『代筆專家』的專屬技能,自動套用到未來草擬的信件」,或是「在每月 1 號檢查 Gmail 上個月的數位發票。如果有訂閱服務漲價或試用期即將結束的服務,請通知我並預先草擬取消訂閱的信」。(詳全文)
Perplexity AI Agent Windows
Perplexity自主代理登上Windows,開始接手Office和本機工作
Perplexity AI推出Windows版Personal Computer自主AI代理,不只能在網頁上查資料,還能跨本機檔案、Microsoft 365和各類企業應用程式執行任務,首波開放Max和Enterprise Max方案用戶使用。
在操作上,使用者可交代一整串工作,例如從「下載」資料夾找出檔案、整理到指定位置,再讀取Outlook郵件和網頁資料,最後更新Excel或PowerPoint檔案。即使使用者暫時離開電腦,AI代理還是能繼續執行;使用者也能從手機下指令,再回到桌機查看成果。
Personal Computer採多模型協作架構,除了Windows原生工具和Microsoft 365,還能透過App Connectors串接Snowflake、Salesforce和HubSpot等400多種服務。Perplexity也規畫加入混合式推論調度能力,依任務需求在本機與雲端之間分配AI運算。(詳全文)
Codex Security AI資安 CI/CD
OpenAI開源Codex Security工具鏈,AI漏洞掃描可直接接進CI流程
OpenAI日前開源Codex Security命令列工具和TypeScript SDK,開發團隊可直接用來掃描本機程式碼、Git版本差異和尚未提交的變更,並把AI漏洞檢查接進程式碼提交前與持續整合(CI)流程。
Codex Security不只能尋找可疑程式碼,還能搭配系統架構、威脅模型及安全政策等文件,理解專案用途與安全要求,再產生漏洞驗證結果和修補建議。團隊也能設定風險門檻,一旦掃描發現達到指定嚴重程度的問題,就讓CI流程自動失敗,阻止有風險的程式繼續往後部署。
掃描結果可匯出為SARIF、JSON或CSV檔案,並比較不同時間的結果,追蹤漏洞是新出現、持續存在、再次發生還是已經修正。TypeScript SDK則方便企業把掃描功能嵌入內部開發平臺。不過,這次開源的是工具與執行流程,核心分析仍需連接OpenAI雲端模型,無法完全離線運作。(詳全文)
Claude Opus 5 Anthropic AI模型
Anthropic推平價版旗艦模型Claude Opus 5,半價逼近Fable 5效能
Anthropic日前推出Claude Opus 5,鎖定程式設計、知識工作和電腦操作等日常任務。它的最大賣點不是單純變更強,而是用約一半的成本,達到接近旗艦模型Claude Fable 5的效能。目前Opus 5是Claude Max方案預設模型,也是Claude Pro用戶可使用的最強模型。
在多檔案程式開發測試CursorBench 3.2中,Opus 5拿下70.0%的分數,只比Fable 5少0.5個百分點,平均每項任務成本只花8.23美元,不到Fable 5的一半。它也更擅長檢查、修正自己的回答,例如自行建立電腦視覺流程重建3D模型,或找出開源軟體錯誤後,進一步補上原本修補程式漏掉的問題。
不過,能力提升也伴隨資安風險。Opus 5尋找軟體漏洞的表現,已逼近高階模型Mythos 5,Anthropic也因此限制滲透測試、二進位漏洞掃描和漏洞利用程式生成。Opus 5的API型號為claude-opus-5,每100萬個輸入及輸出Token分別收費5美元和25美元,與Opus 4.8相同。Anthropic另提供速度快2.5倍的Fast模式,價格則是一般模式的兩倍。(詳全文)
ChatGPT Health 數位健康 電子病歷
ChatGPT Health在美上線,病歷和Apple Health都能拿來聊健康
OpenAI正式在美國推出ChatGPT Health,18歲以上用戶可用來串接Apple Health和醫療院所的電子病歷。因此,ChatGPT不只能聽使用者描述症狀,還能參考檢驗結果、用藥紀錄、看診資料,以及睡眠和活動數據,協助整理健康資訊。
原本OpenAI打算把這些功能放在獨立的Health專區,但測試發現,超過七成健康對話仍發生在一般聊天中。於是,新版把健康資料帶進日常對話,例如推薦餐廳時避開過敏食物,或規畫活動時考慮近期傷勢;使用者也可輸入「@Health」,要求ChatGPT讀取健康資訊。
Health專區則負責管理各種健康資料來源,如Apple Health、電子病歷、醫療服務One Medical和Function Health等,還能查看檢驗趨勢、疾病與用藥紀錄。OpenAI表示,相關資料不會用於訓練基礎模型或投放廣告,解除串接後,來源資料會在30天內刪除。不過,ChatGPT仍可能出錯,定位仍是協助理解健康資訊,而不是取代醫師判斷。(詳全文)

Visual Studio GitHub Copilot AI Coding
Visual Studio強化Copilot代理,內建.NET、Azure技能與團隊共用指令
微軟更新Visual Studio 2026,為GitHub Copilot Chat加入新版Agent預覽功能。它不只能回答問題,還能依開發者要求,自行讀取程式碼、修改檔案並完成多步驟任務,用來開發功能、修正錯誤或重構程式。新版採用與GitHub Copilot CLI相同的SDK,開發者可在CLI、VS Code或GitHub開始工作,再回到Visual Studio檢查成果。
這次更新也內建.NET和Azure團隊製作的技能,就像是產品團隊寫給AI代理的操作手冊,協助Copilot處理Azure升級、環境檢查、C#指令碼和.NET追蹤資料收集等任務。企業還能設定組織共用指令,讓不同開發者使用Copilot時,遵循一致的回答格式與開發偏好。
此外,開發者現在不必切換Git分支,就能把指定分支交給Copilot分析、摘要程式變更。可以說,Visual Studio正把AI代理從個人助理,進一步變成可共用技能、銜接工具並理解團隊規範的開發工作層。(詳全文)

MAI-Cyber-1-Flash AI資安 微軟
微軟揭露首款自研資安模型,AI找漏洞成本比GPT低一半
微軟最近發布首款自行開發的資安模型MAI-Cyber-1-Flash,還整合至多代理漏洞檢測與修補平臺MDASH,主打以更低成本完成漏洞分析和修補工作。官方表示,相較於原本搭配多個GPT模型的方案,新模型的執行成本可降低約50%。
MAI-Cyber-1-Flash可搭配多支AI代理,自動完成找漏洞、分析、修補建議與驗證等流程。微軟在CyberGym基準測試中指出,結合MAI-Cyber-1-Flash與GPT-5.4的MDASH成功率達96%,表現比Google Gemini 3.5 Flash Cyber、GPT-5.6 Sol及Mythos 5等模型還要好。微軟也同步發表代理式資安系統Project Perception,可讓多個AI代理持續監控新漏洞、修補弱點並執行防護工作,未來也將導入MAI-Cyber-1-Flash。(詳全文)

圖片來源/Yelp、Anthropic、OpenAI、微軟
AI近期新聞
1. AMD擴大AI Everywhere布局,涵蓋AI PC、開發平臺到Physical AI
2. Google更新OKF開放知識格式,加入AI代理知識來源追溯與查詢結果驗證
3. Hugging Face公布AI代理人入侵始末,4天半執行1.76萬項操作
資料來源:iThome整理,2026年7月