近期在 AI 圈流傳一個說法:OpenAI 內部已完成一個代號為 Bel 的超大模型預訓練,據傳它不是 GPT-5.x 的小改版,而是被定位為 GPT-6 之後那一代產品的基座模型,目標指向更接近 AGI 的能力邊界。這件事目前沒有官方確認,屬於典型的圈內傳聞,但值得先留意的並不是「AGI 來了」這種標題,而是「完成預訓練」這五個字的技術含義——它代表一個新世代的 base model 已經定型,之後所有的產品命名、能力宣傳、benchmark 數字,都會在這個底座上長出來。
我的判斷很直接:Bel 這個傳聞真正的資訊量,在於它暗示 OpenAI 仍在押注「更大規模的預訓練」這條路,而不是像過去一年市場普遍相信的那樣,已經把重心整體轉移到 post-training 與推理時運算。這是一個路線訊號,不是一個產品新聞。
「完成預訓練」跟「有新模型可以用」之間,差得很遠
很多人看到這類消息,第一反應是「幾時可以用」。但預訓練完成,只代表那台跑了幾個月的訓練機停了,不代表門打開了。
一個超大 base model 從預訓練結束到能面對用戶,中間至少還有幾層:post-training(指令微調、RLHF/RLAIF、推理能力訓練)、安全與紅隊評估、能力遮罩與拒答策略、蒸餾出可負擔的小尺寸版本、推理基建與 KV cache 優化、再到定價與容量規劃。以過去幾代的節奏看,這段路通常用月計,不是用週計。
所以如果傳聞為真,合理的期待是:接下來一段時間你會先在別處看到它的影子——某個 API 出現來歷不明的 model string、某個匿名模型突然在排行榜上異常強、某個「研究預覽」只開放給極少數帳戶。基座模型很少一次現身,它通常先派影子出來試水溫。
傳聞裡最值得注意的四點
1. Bel 是「基座代號」,不是產品名
這一點常被誤讀。GPT-4、GPT-5 是面向市場的產品命名,內部代號則對應某一次預訓練跑出來的權重。傳聞把 Bel 說成「GPT-6 之後的基座」,意思是同一個底座可能會衍生出多個對外產品:一個高推理版本、一個低延遲版本、一個 agent 專用版本。對開發者來說,這比「新模型叫什麼」重要得多——因為它決定了未來一兩年你要適配的,其實是同一家族的行為模式。
2. 「更接近 AGI」在實務上通常指長任務自主性
如果一個新世代 base model 的賣點真的是「更接近 AGI」,那最可能的具體表現不是對話更聰明、寫作更漂亮,而是能不能連續工作幾小時而不走歪。
舉個很現實的例子:現在不少團隊已經在用 agent 跑「讀完 200 頁招標文件 → 抽出所有條件 → 生成回應草稿 → 自檢一遍」這種工作流。用當前世代模型,單步表現都不錯,但跑到第 30 步之後開始出現目標漂移、忘記早期指令、把自己上一步的錯誤當成事實。這種失敗不是「不夠聰明」,是規劃與自我糾錯的穩定性不足。新一代基座如果真的有實質躍進,最先被感受到的就是這裡。
3. 它是「scaling 撞牆論」的一次直接檢驗
過去一年業界主流敘事是:預訓練的邊際回報在下降,所以大家改去堆推理時運算與強化學習。如果 OpenAI 仍然願意燒一輪超大規模預訓練,等於押注 base model 的天花板還沒到。
這件事的結果只有兩種,而兩種都很有意義:新基座帶來明顯的能力跳升,證明大規模預訓練仍然有效;或者提升有限,那市場對「下一代」的想像就要整體降溫。Bel 這個名字最終會變成一個里程碑,或者一個註腳,中間沒有太多灰色空間。
4. 算力節奏對得上,這是傳聞唯一比較硬的支撐
過去一年多,超大規模訓練叢集陸續交付上線,是公開可見的產業事實。一個新世代 base model 在這個時間點完成預訓練,時間軸上是說得通的。這不構成證實,但它讓傳聞從「純想像」升級到「合理」。判斷 AI 傳聞可信度,一個實用的土辦法就是先看算力與電力的時間線對不對得上,因為這部分最難憑空編。
這類消息最容易被誤用的地方
最常見的誤判是:因為聽到有更強的模型在路上,就把手上的專案暫停等新模型。這通常是最貴的選擇——等待期間你沒有累積任何資料、任何 eval、任何使用者回饋,等新模型真的來了,你反而是最沒準備的人。
第二個誤判是把「更接近 AGI」直接翻譯成「可以取代某個職位」。基座能力提升與產品可用性之間,隔著成本、延遲、權限、稽核與責任歸屬。一個能連續工作三小時的模型,如果單次任務成本高到不合理,在商業上依然不成立。
現在該做的,其實只有一件事
如果你在做 AI 產品或 AI 工作流,面對這種傳聞最有價值的準備不是換模型,而是建立一套屬於自己的評測集。
具體到可以今天就開始:把過去三個月你團隊實際遇過的 30 至 50 個真實任務(含那些失敗的)整理成固定測試題,附上你認可的合格標準。下一代模型無論叫 GPT-6 還是叫 Bel 的衍生版,你在發佈當天就能跑一次,用小時計得出「值不值得換」的答案,而不是靠 Twitter 上的體感。
順帶一提,這件事還有個副作用:一個沒有自己 eval 的團隊,換模型只是換感覺。你會永遠停留在「好像變聰明了」這種無法決策的層次。
另外一個低成本準備,是把 prompt 與工具定義從程式碼裡抽出來,做成可替換的配置。過去幾次世代更替都證明了同一件事:新模型往往需要更少的手把手指示、更短的 prompt、更依賴清晰的工具描述。把這些東西寫死在程式裡的團隊,每次換代都要重工一遍。
結論
Bel 目前仍然是傳聞,任何把它當成既定事實去規劃的做法都太早。但它揭示的方向值得記住:預訓練這條路 OpenAI 還沒放棄,下一代競爭的焦點會從「答得多好」轉向「能連續做多久而不出軌」。
所以與其猜它幾時發佈、叫什麼名字,不如問自己一句:如果下個月真的出現一個能穩定跑三小時任務的模型,你手上有沒有一個現成的、值得交給它的工作流程?沒有的話,那才是真正需要處理的問題。
追蹤以下平台,獲得最新AI資訊:
Facebook: https://www.facebook.com/drjackeiwong/
Instagram: https://www.instagram.com/drjackeiwong/
Threads: https://www.threads.net/@drjackeiwong/
YouTube: https://www.youtube.com/@drjackeiwong/
Website: https://drjackeiwong.com/