這兩天在 Reddit 的 LocalLLaMA 社群、Hugging Face 與 NVIDIA 開發者論壇上,一個由李紀為團隊(DeepReinforce)推出的開源模型家族 **Ornith 1.0** 掀起了滔天巨浪。這款基於 Qwen 3.5 與 Gemma 4 權重魔改的 AI 智能體(Agent)專用模型,在多項軟體工程與命令列工具測試中,不僅超越了基底模型,更空降多個權威榜單前列。本文將為你帶來最即時的技術更新、社群實測、自適應腳手架原理以及最新的量化部署進展,帶你全面剖析這項開源新星!

 

 

1. 橫空出世的開源黑馬:李紀為團隊與 Ornith 1.0 的背景

在 AI 領域中,我們通常習慣了大廠如 Google、Meta 或阿里(Alibaba)從零訓練(From scratch)的常規路徑。然而,這兩天引爆社群討論的 **Ornith 1.0**,則是走了一條精緻且極具爆發力的「後續訓練與微調」路線。這款模型家族是由知名學者**李紀為帶領的 DeepReinforce 團隊**(成員包括 5 位專精於 GrandCode 競賽編程與 CUDA-L2 核心優化的頂尖研究員)研發,並以友好的 **MIT 授權協議** 開源釋出。

Ornith 1.0 擁有 262K 的超長上下文窗口(Context Window),家族陣容非常完整,涵蓋了稠密(Dense)與混合專家(MoE)兩種架構:

  • Ornith-1.0-9B Dense: 專為單張消費級顯卡或筆電本地部署設計的輕量級鋼砲。
  • Ornith-1.0-31B Dense: 兼顧推論速度與複雜推理的中堅力量。
  • Ornith-1.0-35B MoE: 混合專家架構,總參數 35B,但每次推論僅活化約 3B 參數,極具效能比。
  • Ornith-1.0-397B MoE: 基於 Qwen 3.5 397B 權重進行強化學習訓練的旗艦型模型,專攻企業級超大專案。

 

2. 核心殺手鐧:什麼是「自適應腳手架(Self-Scaffolding)」?

這是 Ornith 最具顛覆性的技術創新。在傳統的 AI 智能體(Agent)開發中,模型外部通常需要包裹一層人類寫好的「腳手架/執行框架」(Scaffold/Harness),用來限制和引導 AI 如何調用工具、如何儲存短期記憶、何時進行重試等。這種作法不僅繁瑣,且框架是固定的,AI 無法主動最佳化自己的工作流。

Ornith 1.0 徹底打破了這個限制,提出了**「自適應腳手架(Self-Scaffolding)」**概念:

「在強化學習(RL)的訓練過程中,Ornith 不僅在學習如何給出正確的代碼,更在同步學習如何幫自己寫出一套最適合解決當前任務的『思考流程框架』。模型能自己決定要進行幾步推理、何時呼叫外部工具、以及如何自主糾錯。」

這使它在面對複雜工程任務時,具備了像人類資深工程師一樣的「動態規劃」與「自我除錯(Iterative Code Repair)」能力,也是它在實戰中能以小博大、反超數倍大模型的核心武器。

 

3. 揭秘魔鬼榜單與最新戰績:SWE-bench Verified 與 Terminal-Bench 2.1

要評估 Ornith 的含金量,我們必須看它在兩大硬核 Agent 測試集中的表現。Ornith 這次交出的成績單,在開源界確實非常耀眼:

🏆 SWE-bench Verified (軟體工程實戰)

要求 AI 閱讀真實開源 GitHub 專案並解決 Bug。旗艦級 Ornith-397B MoE 跑出了 82.4 分 的天花板表現;而 35B MoE 版本也拿下了 75.6 分。最令人驚奇的是,僅有 9B 大小的 Ornith-9B Dense 居然跑出了 69.4 分,直接將原本 Gemma 4-31B(52.0 分)狠狠甩在身後!

🔗 前往 SWE-bench 官網 →

🖥️ Terminal-Bench 2.1 (命令列與運維)

考驗 AI 在真實 Linux Docker 容器中操作指令與環境配置的能力。在此榜單中,Ornith-397B MoE 成功擊敗了知名的閉源模型 Claude Opus 4.7(70.3 分),但團隊也誠實指出,它目前依然落後於更新一代的 Claude Opus 4.8(85.0 分)以及超大型的 GLM-5.2-744B(81.0 分)。

🔗 前往 Terminal-Bench 專案 →

 

4. 最新實測震撼:多國語言驚喜與量化部署突破

在這兩天(6月28日)模型正式釋出後,全球開發者社群在第一時間將其拉到本地部署,並回饋了幾項非常意料之外的亮眼發現:

🇯🇵 多國語言寫作的「無心插柳」驚喜

雖然 Ornith 1.0 的官方宣傳和測試集全部集中在英文編程與工具調用上,但日本 Classmethod 技術團隊在將 Ornith-9B Dense 部署至 NVIDIA DGX Spark 伺服器並運行日本本地權威測試集 ELYZA-tasks-100 時驚奇地發現:Ornith 9B 在日語自由文本寫作任務中,綜合評分擊敗了 Gemma 4 與 Nemotron!社群分析認為,這是因為強化學習(RL)和自適應腳手架的對齊訓練(Alignment),附帶大幅提升了模型在其他語言中的指令遵從(Instruction Following)能力與邏輯流暢度。

⚙️ 高效能本地端部署與 MCP 支援

在推論部署方面,社群反應極快,目前已經將 Ornith-1.0 整合進最新的 **MCP(Model Context Protocol,模型上下文協定)**,例如透過 Unity MCP 直接讓模型操控本地編輯器。同時,針對最重型的 397B 旗艦版本,開發者已成功利用 Intel Auto-Round 技術將其進行了 INT4 (W4A16) 低損耗量化,僅需兩台普通企業級 GPU 節點即可流暢運行,這無疑極大地降低了企業導入高難度 Coding Agent 的門檻。

 

5. 理性降溫:數據污染質疑與現實局限性

雖然官方的分數與社群初期實測非常驚人,但我們還是需要保持理性思考,不要陷入「分數焦慮」:

  • 「刷榜(Benchmaxxing)」與過度擬合疑慮: 由於 SWE-bench 的考題源自公開的 GitHub Issues,Ornith 作為一款高強度 RL 對齊的模型,確實存在針對這些測試題目集「過度學習/刷題」的嫌疑。一旦遇到企業內部極度封閉、高度客製化的私有代碼庫,它的表現可能無法達到如榜單上那樣神話般的效果。
  • 視覺能力缺失: 雖然 397B 在代碼上極強,但社群用戶也指出它缺乏多模態(Vision)能力。如果你需要處理大量含有 UI 設計圖、流程圖等視覺畫面的寫程式任務,目前仍需要搭配其他多模態大模型輔助。

 

6. 本地部署指南與實戰建議

如果你想在本地體驗這款「會自己寫劇本」的智能體模型,以下是目前社群最推薦的實戰部署方案:

💻 輕量級消費端(筆電、個人電腦)

Ollama 官方已於昨日正式上架了 Ornith 模型庫。你可以直接在終端機中輸入以下指令,並搭配 VS Code 的 **Continue** 插件或 **LM Studio** 進行無痛代碼補全:

# 下載並運行 9B 稠密版(約 5.6GB)
ollama run ornith:9b

# 下載並運行 35B 專家混合版(約 21GB)
ollama run ornith:35b

🚀 企業級或發燒友(多卡、工作站)

推薦下載由社群開發者上傳至 Hugging Face 的 **GGUF Q4_K_M** 格式,或是使用 Intel Auto-Round 量化的 **FP8/INT4** 版本,搭配 vLLM 伺服器進行高併發的企業級 Agentic 工作流調度。

Ornith 1.0 的出現向整個 AI 工業界展示了:開源 AI 的進化不只在於引進更多參數,如何利用強化學習讓 AI 具備「自我規劃思考腳手架」的元能力,才是推動智能體走向全面自主化的不二法門。這款開源黑馬的未來發展,絕對值得每一位開發者持續追蹤!

 

⚠️ 專業免責聲明 (Disclaimer)本文內容僅代表作者個人針對開源社群最新技術文獻、GitHub 開放專案及開發者社群實測回饋之整理分析,並不構成任何特定軟體工程架構或硬體採購之背書。AI 模型的本地效能表現(包括推論速度、顯存佔用及生成正確率)與您的具體顯示卡規格、CUDA 環境配置、量化損失(GGUF/FP8/RTN INT4)以及 Prompt 設計密切相關。於生產環境實行任何自動化代碼寫作或運維腳本前,請務必於隔離沙盒環境(Docker/VM)中進行全面測試。本站不對因使用該模型所產生之代碼錯誤、系統故障或安全漏洞承擔法律責任。
創作者介紹
創作者 小黃老師嘿技術 的頭像
小黃老師

小黃老師嘿技術

小黃老師 發表在 痞客邦 留言(0) 人氣( 842 )