跳至主要內容

作者

發佈日期

閱讀時間

閱讀約 9 分鐘

字體大小

分享

電郵

人工智能新訊

Qwen3.8-27B:只有27B,卻踏入閉源旗艦的戰場

Qwen3.8-27B最令人驚訝的,不是它又刷新了多少項測試,而是一個只有約278億參數的Dense模型,已在部分程式開發、辦公Agent及電腦操作項目追上甚至超越Claude Opus 4.6 Max。回看Qwen3-32B、Qwen3.5-27B與Qwen3.6-27B的演進,可以看到開放權重模型正在改變競爭方式:模型沒有繼續變大,但能獨立完成的工作愈來愈長。更重要的是,它經常用的4-bit量化後,可以部署在一張24GB消費級顯卡上。

人工智能模型的競爭,過去很容易被理解成一場參數規模競賽:模型愈大、運算愈多,能力便愈強。

Qwen3.8-27B展示的卻是另一條路。

它只有約278億參數,遠小於許多閉源旗艦模型,也沒有依靠Mixture-of-Experts架構把總參數推上數千億甚至數萬億。它是一個每次推理都會動用整個模型的Dense模型,但按照Qwen官方公布的結果,它在部分軟件工程、長時辦公、指令遵循與電腦操作測試中,已追上甚至超越表中的Opus 4.6 Max。

真正值得記住的,不是「小模型打敗大模型」這種過度簡化的口號,而是:

當一個27B模型開始承擔閉源旗艦級工作,參數規模已不再是能力邊界最可靠的指標。

27B究竟做到甚麼?

Qwen3.8-27B最突出的地方,不是一般知識問答,而是Agent與軟件工程能力。

與上一代Qwen3.6-27B相比,Qwen3.8-27B在Terminal-Bench 2.1由63.4升至73.0,增加9.6分;SWE-bench Pro由53.5升至61.7,增加8.2分;NL2Repo由36.2升至42.3,增加6.1分。DeepSWE 1.1更由13.3升至42.2,達到上一代的3.17倍;Qwen自家QwenSWEBench則由49.3升至79.0,增加29.7分。

這些測試的共同點,是要求模型處理比「回答一道程式題」更完整的任務。它需要閱讀現有程式庫、理解檔案之間的關係、操作終端、修改程式、執行測試,再根據錯誤訊息修正方案。衡量的不只是模型能否產生一段看似合理的程式碼,而是它能否把工作真正完成。

Agent能力的提升同樣明顯:

CoWorkBench長時辦公工作由61.0升至70.7,增加9.7分。

JobBench專業工作由21.8升至33.4,增加11.6分,相對提升約53%。

Agents’ Last Exam的Pass@1由10.6升至20.4,接近翻倍;總分由27.3升至42.9,增加15.6分。

這意味着Qwen3.8-27B的進步,不只是更懂得回答問題,而是更能維持一段任務:規劃下一步、使用工具、讀取環境回饋、發現錯誤,再繼續完成工作。

它真的超越閉源旗艦嗎?

Qwen官方比較表把Qwen3.8-27B與Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B及Opus 4.6 Max放在一起。最具新聞性的地方,是這個27B Dense模型在若干項目超越表中的Opus 4.6 Max:

測試Qwen3.8-27BOpus 4.6 Max差距
SWE-bench Pro61.753.4Qwen領先8.3分
QwenSWEBench79.063.8Qwen領先15.2分
CoWorkBench70.768.2Qwen領先2.5分
IFBench79.562.5Qwen領先17.0分
LiveCodeBench v690.388.8Qwen領先1.5分
OSWorld-Verified84.372.7Qwen領先11.6分
AndroidWorld81.962.0Qwen領先19.9分
SWE-MM38.627.1Qwen領先11.5分

在OSWorld-Verified與AndroidWorld這類電腦及手機操作測試中,模型不只需要理解指令,還要觀看畫面、辨認介面元素、執行多步操作並處理途中出現的變化。Qwen3.8-27B在這些項目的表現,反映它正在由「生成答案的模型」轉向「能夠在數碼環境中行動的模型」。

不過,這不代表它已全面勝過Opus 4.6 Max。

Qwen3.8-27B在Terminal-Bench 2.1取得73.0,仍低於Opus的78.2;NL2Repo為42.3,低於47.6;GPQA Diamond為89.2,亦略低於91.3。代表高難度綜合推理的HLE差距更明顯,Qwen為30.8,Opus則為40.0。

較準確的說法是:Qwen3.8-27B尚未成為全面最強模型,但它已在若干與實際工作高度相關的Agent、編程及電腦操作測試中進入閉源旗艦級範圍,其中部分取得領先。

還要注意,這批數字主要來自Qwen官方公布的測試。部分基準由Qwen建立,個別評分亦使用其他模型作裁判;不同模型未必採用完全相同的工具框架、推理預算及測試設定。因此,這些結果足以顯示能力方向,卻不應被包裝成已獲全面獨立證實的「擊敗所有閉源模型」。

四代演化:模型沒有變大,工作卻愈做愈長

要理解Qwen3.8-27B為何重要,可以由Qwen3-32B這條Dense路線看起。

Qwen3-32B:把思考模式帶進Dense模型

Qwen3-32B共有32.8B參數,是一個以文字為核心的Dense模型。它把思考與非思考模式放進同一模型:複雜推理可以使用較長的思考過程,簡單問題則可直接回答。它亦支援超過100種語言、工具調用和Agent工作。

不過,這一代仍採用較傳統的Transformer注意力架構,原生上下文為32,768 tokens,透過YaRN可延伸至131,072 tokens。它已具備Agent的雛形,但主要角色仍然是文字推理模型。

Qwen3.5-27B:由文字模型變成多模態Agent基礎

Qwen3.5-27B把參數由32.8B降至約27B,能力範圍卻明顯擴大。

它加入原生視覺編碼器,可以直接理解圖片與影片;架構亦改為Gated DeltaNet線性注意力與Gated Attention混合設計,並加入Multi-Token Prediction。這些改動一方面降低長序列推理的成本,另一方面提升生成速度。原生上下文更由32K提高至262K,模型亦透過大規模Agent環境進行強化學習。

Qwen3.5-27B的意義,是27B Dense模型不再只負責「讀文字和寫文字」,而是開始具備感知環境、理解長內容及調用工具的底層能力。

Qwen3.6-27B:由會寫程式,進化到理解程式庫

Qwen3.6-27B沿用相同的27B Dense混合架構,但把重點轉向真實軟件開發。

它改善前端工作流程、repository-level reasoning及Agentic coding,並加入preserve thinking,讓模型在多輪Agent任務中保留先前的推理內容,不必每一步都重新分析整個問題。

這項改變看似不及增加參數矚目,卻直接影響Agent的工作效率。真正的軟件開發不是一次生成答案,而是閱讀、修改、測試、除錯,再繼續修改。模型能否保留任務脈絡,往往比單次答題分數更重要。

Qwen3.8-27B:由完成一步,走向完成整段工作

Qwen3.8-27B延續27B架構,主要提升來自後訓練、Agent環境及推理策略的改善。

它把preserve thinking設為預設,並加入xhigh、medium及low三種reasoning effort,讓部署者可根據任務在能力、速度與運算成本之間作調整。優化焦點亦由程式生成進一步擴展至長時Agent、專業工作、電腦操作和跨模態軟件工程。

世代規模與架構原生上下文主要轉變
Qwen3-32B32.8B Dense、文字模型32K思考/非思考雙模式、工具調用
Qwen3.5-27B27B Dense、混合線性注意力、原生視覺262K,可延伸至1M由文字LLM變成多模態Agent基礎模型
Qwen3.6-27B延續27B混合架構262K,可延伸至1M強化程式開發、程式庫理解及歷史推理保存
Qwen3.8-27B延續27B架構、改進後訓練262K,可延伸至1M強化長時Agent、專業工作及端到端任務完成率

四代模型放在一起,最清楚的趨勢並不是參數愈來愈多,而是模型能處理的工作單位愈來愈大:由一次回答,到理解一個程式庫,再到持續執行一段完整任務。

「開源」還是「開放權重」?

Qwen3.8-27B採用Apache 2.0授權,容許商業使用、修改及再分發,對企業私有部署相當友善。

不過,嚴格而言,把它稱為「開放權重模型」比「完全開源AI」更準確。使用者可以下載、量化、微調及重新部署權重,但Qwen並未公開完整訓練資料、全部資料處理流程,以及足以由零開始重現模型的完整訓練配方。

這個區別並非文字遊戲。Apache 2.0主要回答「企業可否使用和修改模型」;完整訓練透明度回答的,則是「外界能否完全追溯模型如何形成」。兩者屬於不同層次的開放。

這對本地AI意味甚麼?

Qwen3.8-27B最值得關注的,不只是它在某些排行榜上取得高分,而是它重新界定了消費級本地AI可以承擔的工作。

過去提到本地模型,最常見的理由是私隱:資料不用傳送到第三方伺服器。如今,討論開始轉向能力與自主性:個人、小型企業或專業團隊,能否在自己控制的硬件上,擁有一套足以分析程式庫、閱讀內部文件、操作工具並持續完成任務的智能系統。

這尤其適合幾類使用者:

軟件開發者及DevOps團隊:分析私人程式庫、重構程式、生成測試、操作終端及建立內部coding agent。

專業服務機構:在不把客戶文件交給第三方API的前提下,處理審計底稿、合約、財務資料及研究文件。

企業知識管理團隊:建立本地RAG、文件搜尋及多步研究工作流程。

AI研究及產品團隊:測試工具調用、MCP、瀏覽器操作、computer use及長時Agent。

內容與創作團隊:分析圖片、影片與長文件,建立具人工覆核的內容工作流程。

若用途只是一般問答、翻譯或短篇摘要,7B至14B模型通常更快、更省電,也更容易維護。Qwen3.8-27B的價值主要出現在資料需要留在本地,而且任務複雜度足以使用其Agent和長上下文能力的情況。

最後一個驚喜:一張24GB顯卡便可部署

Qwen3.8-27B的能力已令人注目,但它最終能否改變實際應用,仍取決於普通使用者能否把它部署起來。

答案是:經常用的4-bit量化後,可以。

Qwen3.8-27B的4-bit量化版本約需17至19GB RAM或VRAM。換言之,一張擁有24GB VRAM的RTX 3090、RTX 4090或同級顯卡,已可把模型完整放入顯存,並留下部分空間給運行緩衝及KV cache。

RTX 3090因此成為一個很有記憶點的例子。這是一張於2020年推出的消費級顯卡,到了2026年,仍能承載一個具備視覺、影片理解、推理、程式開發與Agent能力的27B模型。

不過,「模型能放進24GB顯存」不代表可以同時用盡官方標示的262,144 tokens原生上下文。權重只佔記憶體的一部分;輸入愈長,KV cache佔用愈大,圖片及影片亦會增加記憶體需求。對24GB顯卡而言,8K至16K上下文是較穩妥的起點;能否提升至32K或以上,取決於推理框架、KV cache量化、視覺模組與GPU卸載設定。

若要長期處理大型程式庫、數百頁文件或長影片,32GB統一記憶體或VRAM只算較實用的起點,48至64GB會更從容。大量併發服務、完整262K至1M上下文或高精度部署,則仍需要專業GPU、多卡伺服器或雲端推理平台。

因此,硬件結論可以濃縮成一句:

24GB VRAM是Qwen3.8-27B 4-bit單卡部署最有代表性的實用起點,而不是所有使用情境的終點。

當一個能在部分Agent測試超越閉源旗艦的模型,可以在一張消費級顯卡上運行,本地部署便不再只是愛好者實驗。它開始成為企業架構中的另一種選擇:不是把所有智能交給雲端,而是在私隱、成本、延遲、能力與控制權之間重新劃界。

但本地運行並沒有消除責任。模型可以離線部署,不代表輸出可靠;模型能調用工具,不代表應取得無限制權限;模型可以操作桌面,也不代表可以跳過審批、日誌、沙盒與人工覆核。

Qwen3.8-27B把前沿級能力帶到個人工作站。下一個問題已不再是「普通人能否擁有一個強大的AI」,而是:當強大的AI真正進入普通人的電腦,我們準備給它多大的權限?

發表留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

FFOO Labs 通訊

不定期分享關於 AI、科技,以及想像與實踐之間種種思考的筆記。

透過 RSS 追蹤