1. Poolside 開源 Laguna S 2.1:118B MoE 只激活 8B,Terminal-Bench 打贏 1.6 兆參數的 DeepSeek-V4-Pro
Poolside 7/21 於 Hugging Face 發布 Laguna S 2.1:118B 參數 Mixture-of-Experts、每 token 只激活 8B、1M context,採 OpenMDW-1.1 授權開源。官方數據:Terminal-Bench 2.1 拿 70.2%(第 11 名),贏過 1.6 兆參數的 DeepSeek-V4-Pro(64.0)、Thinking Machines 975B 的 Inkling(63.8)與 Nvidia 550B 的 Nemotron 3 Ultra(56.4);SWE-Bench Multilingual 78.5%、SWE-Bench Pro 59.4%。5/22 開訓、9 週上線,只用 4,096 顆 H200。共同 CEO Jason Warner 直說「西方需要能信任、能自己跑、能拿來蓋的開放權重」,是 11 個月來第一個 100B 級西方開源模型(上次是 OpenAI gpt-oss-120b)。
🔗 來源:VentureBeat(📰 媒體報導)
2. Google DeepMind 一口氣推 Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber:長任務 Agent 省 65% token
Google DeepMind 7/22 官方發布三支新模型,主打企業 Agent 高效低價:Gemini 3.6 Flash($1.5/$7.5 每百萬 tokens)、Gemini 3.5 Flash-Lite($0.30/$2.50)、Gemini 3.5 Flash Cyber(資安專用)。官方指 3.6 Flash 在長 horizon 工程任務上比 3.5 Flash 少燒 65% token;3.5 Flash-Lite 比舊 3.1 Flash-Lite 快 2 倍、價差不到 $1。同步預告 Gemini 3.5 Pro 即將登場。VB 定價表顯示 Flash-Lite 落在 DeepSeek V4-Flash($0.42)、MiMo-V2.5 Flash($0.40)之後,卡進 Kimi K3($18)、Claude Opus 4.8($30)之下的中價位帶。
🔗 來源:Google Blog(📌 官方公告)
3. Writer 新論文:只改 AI 應用外殼、不動模型,token 成本掉 61%、品質不縮
Writer 研究團隊 7/22 在 arXiv(2607.06906)發表新論文,系統性優化 LLM「harness」(orchestration 外殼),在不換基座、不 fine-tune 的前提下,成功將每項任務的 tokens 大砍、cost-per-successful-task 最高降 61%、品質保持穩定。論文點名業界「tokenmaxxing」誤區:靠 context 堆疊與粗暴重試取代系統設計,output tokens 疊代放大成本,讓每次降價變成「麻醉劑」。作者 Waseem AlShikh(Writer CTO)直言:「你的帳單是 tokens-per-task × price-per-token,大家只盯後者。」提出的四個對策點名 prompt compression、budgeted reasoning、terse coding、speculative decoding 都因只優化模型單點而失敗,harness 級系統設計才是解法。
🔗 來源:VentureBeat(📰 媒體報導)