1️⃣ Poolside 開源 Laguna S 2.1:118B MoE(8B active)、1M context,9 週從零練到贏過 1.6T DeepSeek-V4-Pro
美國舊金山 AI 實驗室 Poolside 7/21 官方發布並釋出權重 Laguna S 2.1:118B 參數 Mixture-of-Experts、每 token 僅啟動 8B、支援最高 1M token 上下文,於 5/22 開訓,動用 4,096 顆 Nvidia H200 GPU,不到九週上線。Terminal-Bench 2.1 拿 70.2%,勝過 1.6T DeepSeek-V4-Pro-Max(64.0)、975B Thinking Machines Inkling(63.8)與 550B Nvidia Nemotron 3 Ultra(56.4);SWE-Bench Multilingual 78.5%、SWE-Bench Pro 59.4%。權重以 OpenMDW-1.1 授權立即上架 Hugging Face,官方明說要補上「西方 11 個月無新開源前沿模型」的空窗,直接對打中國 Kimi/Qwen/DeepSeek。
🔗 來源:VentureBeat|📌 Poolside 官方公告
2️⃣ 阿里 Qwen-Audio-3.0-TTS-Plus 拿下 Artificial Analysis Speech Arena 供應商語音榜第一,Elo 1,236 壓過 Simba 3.2
阿里巴巴 Qwen 團隊新一代 TTS 模型 Qwen-Audio-3.0-TTS-Plus 於 Artificial Analysis Speech Arena「供應商語音」排行榜登頂,Elo 1,236,僅以 2 分之差擠下 SpeechifyAI Simba 3.2(1,234),Gemini 3.1 Flash TTS(1,214)與 Sonic 3.5(1,207)居次。模型分 Flash 與 Plus 兩版:Flash 主打約 300ms 低延遲即時互動、Plus 主攻音質;支援 16 種語言含 Tagalog、Malay、Thai、越南語與多種中文方言,可用自然語言指定語氣、以 [angry]/[giggles] 加入非語言標籤,並強化噪音/回音參考音訊的聲音複製。速度為短板(16 字/秒),Alibaba Cloud Model Studio 上定價每百萬字 $27.60。
🔗 來源:The Decoder|📰 媒體報導
3️⃣ Writer 發表 AI Harness 論文:不換模型,每任務單價最高降 61%,正面開嗆「tokenmaxxing」
企業 AI 公司 Writer 7 月發表新論文(arXiv 2607.06906),系統性拆解包住基礎模型的 orchestration 層(AI harness),主張不動基礎模型、只優化 harness,每任務所耗 token 大幅下降,「成功任務單價」最高可砍 61%,而準確率不變。Writer CTO Waseem AlShikh 直接點名業界「tokenmaxxing」歪風:把巨大 context window 與暴力 token 消耗當成好系統設計的替代品,實際情況是「發帳單看的是 token/任務 × 單價」,而 agentic loop 每輪都在重傳 context,token/任務的膨脹遠比單價下滑更快。論文並批評 prompt 壓縮、預算式推理、terse coding、speculative decoding 都是「只優化模型不修流程」的偏方,替企業級 AI 成本失控提供第一個系統性解法。
🔗 來源:VentureBeat|📰 媒體報導