人工智慧(AI)正從過去「你問我答」的聊天機器人,逐步走向能自己規劃、執行任務的「AI代理」。隨著AI工作時間拉長、處理任務變複雜,企業對AI的需求也不再只是模型「夠不夠聰明」,而是希望同時兼顧速度、成本、隱私與部署彈性。
NVIDIA宣布推出Nemotron 3.5 Lightning,進一步擴充Nemotron 3系列開放模型,鎖定長時間運作的AI代理工作負載。這款模型擁有300億參數,採用「混合專家」(Mixture-of-Experts,MoE)架構,主要用於程式碼審查、工具操作、安全監控及帳務問題等專門任務。
當前熱搜:為何大爆炸怒噴傅崐萁? 昔韓國瑜核心幕僚今抖內幕....
簡單來說,未來AI不一定什麼事情都交給同一個大型模型處理,而是像一個團隊一樣,讓不同模型各自負責最擅長的工作。
Nemotron 3.5 Lightning主打快、準 能自己客製化
NVIDIA表示,相較於同級模型,Nemotron 3.5 Lightning輸出速度最高可提升4倍,並可讓代理型任務完成速度提升30%。由於模型採開放且可客製化設計,企業還能透過NVIDIA NeMo,加入自己的產業資料、工具及工作流程進行後訓練,進一步提高特定任務的準確度。
當前熱搜:為何傅崐萁在韓國瑜動怒後欲開記者會又取消? 他酸:可能不在立院趕不回來吧…
目前已有企業將其應用在不同領域,例如CrowdStrike用於網路安全、Harvey及Trajectory投入法律服務,CodeRabbit與Baseten則應用於程式碼審查。
更重要的是,企業不一定要把AI全部丟到雲端。Nemotron 3.5 Lightning可以運行在NVIDIA RTX PC、DGX Spark、DGX Station、Jetson等本地設備,也能延伸到工作站、資料中心、邊緣裝置與雲端環境,讓企業能依照隱私、成本及速度需求選擇部署方式。
NeMo Switchyard登場 讓AI自己挑最適合的模型
除了新模型之外,NVIDIA同步推出開源函式庫NeMo Switchyard,解決另一個關鍵問題:當企業手上有很多不同AI模型時,到底該用哪一個?
NeMo Switchyard可以把它想像成AI世界的「智慧交通指揮中心」。系統會根據每一次請求的內容,自動判斷最適合的模型,再把工作交給它。
例如,簡單問題可以交給速度快、成本低的小模型;複雜推理則交給能力更強的大模型;需要高度隱私的工作,也可以選擇在本地端運行的模型。
NVIDIA表示,內部測試顯示,NeMo Switchyard在維持前沿模型等級準確率的同時,完成任務成本可降至單獨使用Opus 4.8的近三分之一。部分合作夥伴測試也顯示,透過智慧路由可在維持品質的情況下大幅降低成本。
AI代理進入「模型團隊」時代
這次NVIDIA的布局透露一個重要趨勢:AI競爭可能不再只是「誰的模型最大、參數最多」,而是誰能把不同模型有效組合起來。
未來一套完整的AI代理系統,可能由大型推理模型負責規劃,再由多個小型專用模型分工執行,最後透過智慧路由決定每個任務該交給誰。
Nemotron 3.5 Lightning目前已在Hugging Face、ModelScope、OpenRouter及build.nvidia.com等平台提供,也可透過NVIDIA NIM微服務使用;NeMo Switchyard則已在GitHub開放。
從「單一AI模型」走向「多模型協作」,NVIDIA這次推出的新工具,也讓AI代理從單純追求智慧,進一步朝向更快、更省、更能客製化,也更容易部署的方向發展。