🤖 AI 日報 #7/10 — 2026/07/20(15:00)

🤖 AI 日報 #7/10 — 2026/07/20(15:00)

1️⃣ Intuit VP AI 揭 4 個月內把 agent 架構砍掉重練兩次:中央 orchestrator 敗給「10 個 agent 每次自然語言交棒都在複利掉 context」

Intuit VP of AI Nhung Ho 於 VB Transform 2026 揭:從一組 specialist agents 改採中央 orchestrator 撐了 3 個月即崩潰,因為每次 agent 自然語言交棒都損失 context、10 個 agent 錯誤呈複利式擴大。60 天內二次重寫為 skills/tools 架構,20 天出可運行版本。新架構讓真人專員(Intuit 產品支援、客戶自己的會計、Intuit 簿記員)可在對話中即時接手完整 agent 上下文,目前對 1% 客戶開放,未來數週擴大。反饋率從 0.3% 客戶提供意見拉到近 100%。

🔗 來源:VentureBeat

2️⃣ Amazon AGI 部門主任:85% 企業試 agent 只有 5% 上線,卡點不是能力是「可靠度」,得把 reliability 拆成 4 個獨立向度來量

Amazon AGI Autonomy 主任 Bryan Silverthorn(自 Adept AI 併入 Amazon)於 VB Transform 2026 引 Princeton 研究,主張 agent reliability 必須拆成 consistency、robustness、predictability、safety 四個獨立向度分別評估。舉某客戶 QA agent 抓螢幕序號 2 個月完美,卻因底層 vision encoder 對序號位置敏感、一次無感軟體改版就開始間歇讀錯。內部把 agent 叫「intern」——聰明但偶爾脫線,需要的是管理技巧不是軟體技巧。指出主流企業僅追蹤 uptime 卻不追蹤 accuracy,多數靠模型商自家 evals 湊合。

🔗 來源:VentureBeat

3️⃣ Brex 開源 CrabTrap:把 agent 治理搬到「網路傳輸層」,用 LLM-as-a-judge 攔截每一次 HTTP 請求,policy 從 agent 實際流量自動長出來

Brex 共同創辦人 CEO Pedro Franceschi 對 VentureBeat 揭 Brex 開源 CrabTrap(HTTP/HTTPS proxy):透過 HTTP_PROXY/HTTPS_PROXY 攔截 agent 每一個外部請求,先跑靜態規則、剩餘 <3% 長尾未知端點交 LLM-as-a-judge 判斷放行或阻擋。關鍵設計:policy 不由人類從零撰寫,而是先以 shadow mode 觀察 agent 真實流量、由另一個 agentic loop 起草自然語言 policy 再由人類編修,「從實際行為 bootstrap 遠比從白紙開始準確」。框架與語言無關,可包 OpenClaw/Claude Code/MCP 等任何 agent 系統,補上 SDK 權限與 MCP gateway 之外的第三層。

🔗 來源:VentureBeat