Vanilla Lab

← 回文章列表

我在一台 0.99 美金的小主機上,讓中美四大 AI 模王對賭股市...

2026-07-13

中美 AI 四大模王交易競技場排行榜

先說結論:整個「中美 AI 四大模王交易競技場」,跑在一台只有 960MB 記憶體、單核心、連 swap 都沒有的 VPS 上。


一個月機器錢——0.99 美金。


連超商一杯拿鐵都買不到

我拿它跑起四個大模型同場對賭股市的正式站...

我對「哪個 AI 最強」這種問題沒興趣

跑分只證明它會考試

我要看的是判斷力

所以把四個模型丟進最會打人臉的地方:股市

讓它自己做決定

自己扛後果..


規則:只換模型,其他全一樣


四個中美代表參賽者 :

DeepSeek V4 Pro

字節火山 ark-code

Google Gemini

OpenAI GPT-5.6

各拿一模一樣的虛擬本金(台股 100 萬、美股 10 萬鎂)

同一批股票

同一套 prompt

只換模型


每天收盤各跑一輪

虛擬撮合

獨立記帳

公開排行榜


變因只有一個:模型的腦。


全程用 Hermes + DeepSeek 手搓

後端一個虛擬撮合引擎

用當時市價模擬成交

寫進帳本、去重

決策層把四家 API 逐一綁進來

各建一個隔離的模型實例

(這裡有個坑:要清掉 fallback,不然某家掛了會被別家頂替回答、卻記在它頭上,PK 就作弊了)。

DeepSeek 幫我把九成的碼寫掉。


第一天,模型的個性就藏不住


我本以為大家會差不多...

結果第一輪跑完

畫面很有戲:

四強裡面,只有 GPT 一張都不買。

它的理由白紙黑字:「僅有即時價格,缺乏趨勢、估值與風險訊號,暫不進場。」

很嚴謹,教科書級別機車的答案。


但另外三強 >> DeepSeek、火山、Gemini

全都積極佈局、幾乎滿手

同一組「只有價格」的資訊,它們選擇下判斷、扛風險。

最貴、最有名的那個,反而最龜 (反應了當家的個性 ?

第一天而已

我不急著說誰對

但這個對比本身就夠玩味了


精簡到極限,就是會撞到天花板


接下來是給看得懂的人看的部分(看不懂當我在唸咒沒關係 😏

我的原則一直是:用最精簡的設備,做最好的事。

這台 0.99 鎂的 VPS 便宜到不行,正常只夠跑個小網站。

我偏要它同時扛:一個正式站,四個大模型輪流決策,一頁即時排行榜。


代價就是 >> 天花板很近...

上線那個凌晨

我在服務還跑著的時候又開了一個吃記憶體的程序

兩份疊起來瞬間把 960MB 榨乾

機器 thrash 到 SSH 和網站雙雙卡死

ping 得到,連接埠開著,但什麼都動不了。


這不是意外,是在極限規格上作業的必然

解法也很極簡:補一塊 2GB swap 當緩衝,把一個誤帶進來,機器上根本不存在的模組拿掉(它害整個服務進入每幾秒自殺一次的重啟迴圈),服務就穩穩站住了。

沒有加錢升級機器,是把現有的榨得更準,牙膏擠到底才對味


同樣「精簡但夠用」的還有:

HTTPS 憑證用 Caddy 自動跟 Let's Encrypt 要,零設定

網域的 DNS 因為我家網路把主機 IP 擋了

乾脆從 VPS 那端直接打過去加記錄

能不花錢,不加機器解決的,就不加。

(中間還揪出一個安全金鑰不小心進了公開倉庫的洞,連夜補掉)


我想證明的事

一半好玩,一半是驗證我一直在講的:

模型不是越貴名氣越大越好

極簡的設備也做得出好東西


在這個競技場裡

DeepSeek / 火山跟 Gemini / GPT 站同一條起跑線

沒有濾鏡

沒有信仰的加成

純粹靠數字說話


而承載它們的

是一台一個月 0.99 美金

連杯超商拿鐵都換不到的小機器


大家願意多付的那些「品牌溢價」「規格溢價」到底值不值??

我沒意見

讓淨值曲線和那台沒倒下的小主機慢慢說話


醜話講前面

這是虛擬撮合的實驗

不碰真錢

不是投資建議

不是報明牌

拿來看模型判斷力的

不是給你抄的作業

看戲歡迎

下單自己負責


天天更新,台股下午收盤、美股隔天清晨各跑一輪。想看誰笑到最後:

👉 arena.wow.to


౨ৎ Anthony 不負責任編輯 ~

留言 (0)