1️⃣ Bloomberg:Google 員工自己都不信 Gemini 4?跑分很強、實戰卡關
Google 開始推出旗艦模型 Gemini 4 Argon 之際,Bloomberg 報導內部對其實戰表現存疑:基準測試成績亮眼,但員工實際使用時尤其在前端 coding 明顯吃力,重燃「benchmaxxing(只衝高分)」的批評。Google 回應稱報導「不準確」,也有員工形容內部有「大型共識」認定模型屬前緣等級,但消息曝光後 Alphabet 股價回吐當日多數漲幅。模型實力與跑分的落差,正成為整個產業的信任議題。
🔗 來源:Bloomberg(媒體報導)
2️⃣ Robinhood 推出「Robinhood Agents」:AI 代理全天候替你下單
Robinhood 在休士頓 HOOD Summit 發表 Robinhood Agents,用戶可自建 AI 代理研究市場、組建策略並代替交易。每個代理綁定獨立帳戶,只能動用該帳戶資金,可自選底層模型(OpenAI GPT-Luna 年底前免費),未來 Loops 功能將支援盤外自動循環策略。這是大眾消費金融產品首度把資金裁量權交給 LLM 代理——散户的 AI 治理與風控問題也隨之浮上檯面。
🔗 來源:CNBC(媒體報導)
3️⃣ Anthropic 研究:機器人能做全美 3/4 體力任務,成本划算的只有 0.3%
Anthropic 研究團隊發表機器人暴露指數:以機器人「今日實際能力」而非遠期預測估算,機器人可執行約四分之三的美國體力任務、涵蓋 34% 工時,但成本具競爭力的僅 0.3%;結合 LLM 後約 80% 工時暴露於兩者之一。按歷史降價速度,機器人要約 40 年才達 10% 成本競爭力,且暴露勞工以男性、低學歷、低薪者為主——把「AI 搶工作」的討論拉回數據面。
🔗 來源:Anthropic 官方研究(官方公告)