NeoTrade 的 Evolve 讓代理回顧舊任務、篩選經驗,再把內容寫入下一輪可用的記憶。 NeoSoul 在 2026 年 9 月 10 日的 Evolve 發布說明公布這項更新。工程團隊導入時,要分開驗收判斷品質與權限控制。更新後的決策是否改善,資金和工具權限是否仍受外部規則約束,各自需要證據。一次獲利,無法同時回答這兩個問題。
Evolve 改的是下一輪能讀到的經驗
依官方發布說明,Evolve 會回顧過去的執行紀錄,把篩選過的訊號寫回記憶。同一個代理下次執行時,就能讀取這些內容。這份公告描述的是執行環境中的記憶更新,沒有提供底層模型在使用者電腦上自行重訓的證據。
NeoSoul 的元件文件把模型、記憶、操作手冊與工具列為不同元件。記憶保存跨任務的背景,操作手冊記載可重用的決策流程;harness 則把它們放進任務、權限和評估流程。這裡的 harness,可理解為代理的執行架構。
採購或開發評估時,要能看到具體改了什麼。若 Evolve 新增一條經驗,團隊需要知道它來自哪些紀錄、適用哪些情境,以及何時應失效。「下次多讀了一段文字」可以驗證;「從此更懂市場」還需要另外的測量。
目前能接哪些市場,文件寫得比宣傳更窄
截至 2026 年 9 月 11 日核對,NeoTrade 產品文件列出的現有環境是 Paper、predict.fun 與 Polymarket,桌面客戶端支援 macOS 與 Windows。Paper 是模擬環境,不能把它和真實資金交易的結果放在同一欄比較。
產品狀態表把更廣泛的 CEX、DEX 與美股等市場列為規劃;可驗證的行為與版本紀錄機制仍有開發中的部分。對準備串接系統的團隊而言,要先依這些狀態規劃介接。上線範圍會影響帳戶介接、訂單狀態和測試資料,不能從一張市場擴張圖推定所有市場已經可用。

官方市場擴張圖應讀成路線圖;它沒有證明跨市場策略已通過驗證。
RSI-Exam 的高分,驗收的是指定測試產物
自我改進的討論有一個可對照的工程基準。RSI-Exam 官方榜單在本次查核時列出 GPT-6-astra 得分 0.5126,GPT-5.6-sol 為 0.4331,GPT-5.5 為 0.3312。Astra 相對 Sol 高約 18.4%,這是兩個平均分的相對差距,不能寫成答對率增加 18.4 個百分點。
RSI-Exam 0.1 有 88 項任務,分為 35 項公開與 53 項非公開任務。每項任務還有供開發使用的可見資料與最後評分的隱藏資料。這兩種切分屬於不同層級,不能把「公開任務」當成「只在公開資料上測試」。
依評測方法說明,代理提交可執行的解法或執行架構,評分器在隔離環境中用隱藏資料重跑。基準起點設為 0;存在適用上界時,上界映射到 1。這種正規化分數衡量指定任務的改善,沒有直接衡量市場報酬。研究初版也說明每個模型在每項任務只有一次執行,無法估計同一模型重跑時的波動。
| 比較項目 | 可核對的事實 | 導入時不能推定的事 |
|---|---|---|
| Evolve 更新 | 回顧舊任務並寫回記憶 | 底層模型權重已自行更新 |
| RSI-Exam 0.1 | 88 項任務,35 項公開、53 項非公開 | 分數就是交易獲利能力 |
| Astra 與 Sol | 0.5126 對 0.4331,約高 18.4% | 每次執行都穩定領先同樣幅度 |
| NeoTrade 現有範圍 | Paper、predict.fun、Polymarket | 路線圖中的美股等市場已全面可用 |
對 NeoTrade 最有用的借鏡,是把「產生修改」和「驗證修改」分開。Evolve 能產生新的記憶內容,不代表那些內容已在未見過的任務中保住優勢。
記錄要在決策當下留下
NeoSoul 的決策資料文件要求把來源時間、事件定義、假設、判斷、執行影響與結果串起來。這能讓團隊追查:問題出在資訊過期、機率估計,還是訂單執行。只保存事後心得,會把這些不同的錯誤混在一起。
以下是供整合團隊使用的紀錄規格建議,並非聲稱 NeoTrade 已提供同名 API 欄位。每次執行分配一個不可重用的 run_id,保存 model_version、memory_version、playbook_version 與 policy_version。證據另附 observed_at,結果則使用獨立的 resolved_at,避免後來才知道的答案流入原始決策背景。
若有下單,還要把建議動作、規則檢查、實際送單、成交與取消結果分開保存。代理說「應該買進」與交易所回報「已成交」,是兩個不同事件。以同一個執行識別碼關聯它們,才能核對哪個環節引入了成本或例外。
這份紀錄還必須包含沒有下單的情況。只保存成交案例,團隊看不到代理曾放棄哪些判斷,也難以比較新版本是否靠增加交易頻率換取表面上的成功次數。
記憶可以更新,授權不能跟著漂移
NeoSoul 的風險控制文件列出最小權限、使用者設定的資金限制、市場範圍、頻率約束及異常暫停。這些是產品聲明的設計邊界,仍須由整合測試確認每個執行路徑都會經過檢查。
在架構上,提出改進的代理不應同時擁有修改資金規則的寫入權限。可以讓它提交候選記憶與理由,再由獨立的驗證流程決定是否升版。訂單執行器每次接到動作時,依目前有效的授權重新檢查;不能只信任模型文字中「已符合限制」的宣告。
一個值得納入測試的案例,是候選記憶要求提高單筆金額,而帳戶政策沒有變更。預期結果應是執行器拒絕越界動作,並留下拒絕原因。這是本文提出的驗收案例,不能當成已實測 NeoTrade 的結果。

官方權限圖把自主管理資產、確定性控制與可驗證紀錄放在同一個設計中。圖示表達的是設計主張,不能取代權限測試報告。

從模擬進入實盤,要重新驗證成本
NeoSoul 的驗證文件列出四個階段:離線評估、Paper 驗證、受限制的實盤執行,以及稽核結果與事後檢討。文件同時評估預測品質、執行品質和規則遵循等面向。這比把獲利次數當成唯一成績完整,但仍是方法說明。
先凍結現行版本,再用事先保留的後續時段比較候選版本。測試期間不得把結算答案寫回候選記憶,再宣稱它預測成功。兩個版本應面對相同的資訊截止時間,並記錄被拒絕的工具呼叫與缺漏資料。挑選勝出版本的資料,也不宜再次充當最終驗收資料。
模擬階段過關後,實盤仍有成交量、延遲、費用與滑價。這些因素可能吞掉預測改善帶來的優勢。營運成本還包括模型呼叫、資料取得、紀錄保存與人工處理例外的時間;只看交易損益,會漏掉提供這項服務的成本。
假設同一類已結算事件的預測都是 70%,長期觀察應檢查實際發生比例是否接近這個水準。單一事件落空沒有直接否定這個機率。這是機率校準的示意,並非 NeoTrade 的量測結果;相關事件也不能全部當成獨立樣本。
截至查核日,本文查閱的公開資料不足以證明 Evolve 已在獨立、扣除成本的實盤比較中持續改善表現。這個證據缺口應保留在產品評估表上,不能用代理數量、預測筆數或漂亮的回顧文字填掉。
常見問題
Evolve 會自己重訓模型嗎?
2026 年 9 月 10 日的發布說明描述回顧任務與寫回記憶,未提供底層模型自行重訓的證據。NeoSoul 較廣泛的 RSI 文件包含模型與執行機制的評估流程,不能全都視為這次 Evolve 更新的功能。
RSI-Exam 的 0.5126 是答對率嗎?
不是。它是官方榜單上的平均正規化隱藏測試分數,各任務依自己的指標與基準映射。0.5126 不能直接寫成答對 51.26% 的題目,也不能換算成交易報酬。
NeoTrade 現在可以交易所有資產嗎?
官方文件目前列出 Paper、predict.fun 與 Polymarket。更廣泛的交易所、加密資產與美股等市場仍在規劃中,應依具體版本與官方狀態核對。
導入團隊應先驗收什麼?
先核對記憶版本能否追溯到決策證據,再測試候選更新是否通過樣本外比較。資金與工具權限須獨立驗收,包含越界拒絕、暫停與復原;模擬成績通過後,實盤成本仍需另測。
權威來源
- NeoTrade 官方產品頁,產品定位、權限與流程圖。
- NeoSoul 元件文件,模型、記憶與操作手冊的分工。
- NeoTrade 產品文件與產品狀態表,目前環境與規劃中的範圍。
- RSI-Exam 官方榜單與方法說明,分數、任務切分與限制。
- NeoSoul 決策資料、風險控制與評估驗證,工程驗收的文件依據。
- NeoSoul 遞迴自我改進文件,較廣泛的系統更新範圍與約束。
Author Insight
我會讓 Evolve 提出候選版本,再交給獨立的驗證流程決定是否採用。這樣每條新記憶都有可退回的版本,也能追查它影響了哪些決策。當團隊只能展示更完整的回顧,卻拿不出未見資料上的比較,採用理由就還不夠。
術語表
- Harness:管理代理任務、工具、記憶、權限與評估的執行架構。
- 樣本外驗證:使用未參與修改與挑選的資料,檢查改善能否延續。
- Paper:使用市場資訊進行模擬,不投入真實資金。
- 機率校準:比較一類機率判斷與長期實際發生比例。
