1. Anthropic 於 Claude Cowork 上線「Record a skill」:錄螢幕+語音旁白,自動存成可重複執行的 AI 技能
Anthropic 於 Claude Cowork 桌面 App 新增「Record a skill」功能:使用者錄下執行某任務的螢幕操作與滑鼠鍵盤動作,同時語音口述說明,Claude 會自動把整段錄影轉為可重複呼叫的 skill 存下,下次遇到同任務直接執行不必再手把手教。功能位在 Cowork 的「+」選單,開放 Pro/Max/Team 訂戶,直接對打 OpenAI Codex 先前推出的「看你做一次、以後自動重播」錄製工作流,把 agent 個人化與流程自動化的門檻進一步壓低。
🔗 來源:The Decoder
2. 阿里 Qwen 團隊發表 Qwen-Image-3.0:4,500 token 長 prompt、可讀 10 px 小字、一次生成 3×3 資訊圖表格
阿里 Qwen 團隊發布第三代圖像模型 Qwen-Image-3.0,主打「Real」實用生產力:接受最長 4,500 token prompt,可在單張圖內完成 3×3 九格資訊圖、模擬報紙版面、含 LaTeX 公式的學術論文頁與手寫紅字批註,最小可讀文字壓到 10 像素;原生支援 12 種語言,示範包含把 VSCode → Qwen Chat → WeChat → 沖咖啡海報層層巢狀 UI 一次繪出,也能修復破損傳統水墨畫並匹配原筆觸。與前作只求「精準、美觀」不同,這代把靜態圖像模型直接推向試卷、故事板、報紙等一頁式排版生產場景。
🔗 來源:The Decoder / Alibaba Qwen team
3. 小米開源 Xiaomi-Robotics-1:10 萬小時「手持夾爪」資料證明資料量比模型大更關鍵,未見場景成功率 25%→75%
小米發表並於 GitHub 開源機器人基礎模型 Xiaomi-Robotics-1:跳過昂貴機器人,用手持式夾爪+攝影機由「人」在廚房、辦公室、賣場、工廠、戶外 1,700+ 場景手動採集,累積 10 萬+ 小時動作資料,並以另一 AI 兩週內完成全資料集自動標註。實驗顯示對機器人視覺-運動模型,加大資料比加大模型更有效——資料量從小加到大,機器人在陌生場景成功率由 25% 升到 75%,且尚未見飽和。用 <10 小時新任務資料,Xiaomi-Robotics-1 在收行李、洗衣、送紙、裝箱四任務平均成功率達 75%,勝 Physical Intelligence 對照模型的 40%。示範中機器人自行完成 10 分鐘的整理行李箱任務。