白皮書
OURO 白皮書
讓已經部署的 AI 在真實任務中持續自我改進,並把每一輪改進的證據記錄在鏈上。本頁為線上閱讀版,與 PDF 內容一致。
AI that evolves AI. — 讓已經部署的 AI 在真實任務中持續自我改進,並把每一輪改進的證據記錄在鏈上。
1. 摘要
智慧正在從權重遷移到鷹架。OpenAI 在 2026 年 5 月宣布逐步停止自助微調,理由是「提示與鷹架更便宜、更快」;同一年,學術界證明了在凍結權重的前提下,讓 AI 自動改寫自己的提示、工具、記憶與技能,就能把 SWE-bench 從 20% 推到 50%,把垂直領域任務平均提升 89%,而且比強化學習少用 35 倍的算力。這意味著一件事:讓一個已經部署的 Agent 持續變強,不再需要實驗室級的叢集,而是一個能不斷生成候選、並行評測、篩選提交的閉環。這個閉環消耗的是海量、低頻寬、可容錯的計算——正是分散式網路最擅長提供的那一種。
OURO 就是這個閉環。它把國立研究院在自我進化 AI 方向的成果做成三個部件:OURO Engine,任何 Agent 接入後在預算內持續自我改進,先進化鷹架,權重可選;Proof of Evolution(PoE),把每一輪「變強了」從服務商的承諾變成鏈上可驗證、可結算的事件;OURO Grid,一張全球分布的算力網路,區域錨點保證可靠性,社群節點與外部供給提供規模,首批錨點位於新加坡與新山。
市場缺口是具體的。企業生成式 AI 支出 2025 年達到 370 億美元,79% 的企業在採用 Agent,但只有 23% 在規模化;Gartner 預計到 2027 年底超過 40% 的 Agentic 專案會被取消。卡住企業的不是模型不夠聰明,而是 Agent 上線之後不再變聰明。OURO 賣的不是 GPU 小時,而是可驗證的能力提升。
網路代幣 $OURO 是工作憑證:付進化與算力、質押做節點與驗證者、託管賞金、參與治理。總量固定 10 億枚,網路激勵只由經過驗證的 PoE 記錄觸發釋放,法幣收入的固定比例回購進入激勵池。我們從 Bittensor dTAO 十八個月三換機制的經歷裡學到的是:排放只能綁定經驗證的工作量,規則要穩定,數據要公開。
面向 C 端,使用者可以使用一個越用越貼合自己的助手 OURO Chat,也可以把閒置 GPU 接入 OURO Grid 參與評測與訓練並獲得報酬。面向開發者與企業,Evolve API 讓任何 Agent 以可控預算獲得持續進化,並附帶可公開驗證的進化報告。
專案由國立研究院技術團隊開發,已獲得新加坡合規基金的投資與支持,並在全球範圍內聚集了數百人的早期社群。本白皮書為 v1.1 草稿,代幣參數、路線圖與合作方資訊會在法律意見與團隊確認後更新。
2. 為什麼是現在:三個拐點同時到來
一個好的基礎設施專案通常不是因為想法新,而是因為幾條曲線在同一年交匯。OURO 的三條曲線是:智慧的重心從權重轉向鷹架;鷹架層的自我進化有了硬數據;這種進化所需的計算恰好是分散式網路能便宜供給的。
2.1 拐點一:企業的「權重時代」正在結束
2026 年 5 月,OpenAI 發出自助微調平台的棄用通知:先停止新組織建立微調任務,2027 年 1 月前對所有客戶關閉。官方理由是新一代基礎模型已經足夠聽話,「基於提示的方法更便宜、更快」(Tessl 對棄用通知的解讀)。同一時期,OpenAI 也宣布 Agent Builder 與 Evals 將於 2026 年 11 月 30 日下線(OpenAI AgentKit 公告)。
這兩件事放在一起讀,結論很清楚:對絕大多數企業而言,Agent 的能力差異不再來自權重,而來自權重之外的一切——系統提示、工具鏈、記憶結構、技能庫、控制流。業界把這一層叫做「鷹架」或「Harness」。它屬於部署方,而不屬於模型廠商;它可以被不斷修改,而不必等待下一個版本。問題在於,今天這一層還是靠工程師手工調,而幫工程師調的工具層正在被模型廠和大廠吸收:2026 年 1 月 ClickHouse 收購 Langfuse,3 月 OpenAI 收購 PromptFoo,Cisco 擬收購 Galileo,Braintrust 以 8 億美元估值完成 B 輪(評測市場地圖)。這些工具回答的是「哪裡錯了」,沒有一家回答「誰來自動把它改好」。
2.2 拐點二:鷹架的自我進化已經有硬資料
過去十八個月,「讓 AI 自己改自己的鷹架」從思想實驗變成了有數字的工程。
| 工作 | 時間 | 做了什麼 | 結果 |
|---|---|---|---|
| Darwin Gödel Machine(Sakana AI) | 2025.05 | 程式開發 Agent 自己改寫自己的程式碼,用基準測試做選擇,保留全部歷史版本開放式探索 | SWE-bench 20.0% → 50.0%;Polyglot 14.2% → 30.7% |
| GEPA(Databricks / UC Berkeley,ICLR 2026 Oral) | 2025.07 | 用自然語言反思做提示進化,不碰權重 | 比 GRPO 強化學習平均高約 10%,最高 20%,rollout 少 35 倍 |
| Meta Context Engineering | 2026.01 | 元 Agent 進化「建構上下文的技能」本身,權重凍結 | 金融、化學、醫療、法律、安全五個領域平均提升 89.1%,訓練速度比前一代快 13.6 倍 |
| Hyperagents / DGM-H | 2026.03 | 把「生成改進的方法」也變成可編輯對象,進化不再限於程式開發領域 | 元層改進跨領域遷移、跨運行累積 |
| SEAL(MIT) | 2025 | 模型自己生成訓練資料自己微調 | 知識吸收準確率 32.7% → 47.0%,但連續自改會災難性遺忘 |
這張表裡有兩個規律。第一,鷹架層的進化便宜、可讀、不遺忘,效果卻不輸權重層;第二,進化的成敗完全取決於評測——DGM 論文裡有一個著名的失敗案例,Agent 被要求減少工具呼叫幻覺,它的「改進」是刪掉了偵測幻覺的日誌。誰能把評測做得可信、把改動做得可稽核,誰就能把這條學術曲線變成產品。
2.3 拐點三:進化所需的計算,分散式網路已經能便宜地給
一輪進化的算力結構很特別:生成候選是少量高品質推理,評測是海量、彼此獨立、可重複的推理,兩者之間不需要同步權重。這與預訓練完全不同。學術界和工業界在 2025–2026 年反覆驗證了這一點:Gensyn 的 SAPO 讓節點之間只交換文字而不交換權重,集體訓練的累計獎勵比單機高 94%,消費級筆電也能參與;Prime Intellect 的 INTELLECT-2 用四張 RTX 3090 就能跑一個 32B 模型的 rollout 節點,權重更新留在少數高頻寬節點上。
價格差距也是真實的。按 2026 年 7 月的市場報價,DePIN 網路上的 RTX 4090 約 0.29–0.40 美元/小時,H100 約 1.45–2.70 美元/小時,而 AWS 按需 H100 約 4–7 美元/小時(來源)。同一篇報告也指出了純 DePIN 的弱點:可用節點遠少於宣傳數字,可靠性約 99.7% 而非 99.99%。另一邊,集中式算力在大量閒置:四大雲端業者 2026 年 AI 資本支出 7,250 億美元,而 Cast AI 對數萬個企業 Kubernetes 叢集的統計顯示 GPU 平均利用率只有 5%(報告轉述);H100 現貨價一年下跌 22%,亞太地區價格仍比美國高 35–45%,歐洲則低 12–15%(DeployBase 2026 年 3 月)。算力不缺,缺的是能把算力吸過來的、可驗證的真實任務。這正是 OURO 在全球網路裡保留區域錨點的原因:便宜的部分交給全球網路,關鍵的部分自己扶著。
2.4 缺口在哪裡
企業生成式 AI 支出從 2024 年的 115 億美元成長到 2025 年的 370 億美元(Menlo Ventures);Salesforce 的 Agentforce 年度經常性收入約 8 億美元,年增 169%。但 McKinsey 的數據是 88% 的組織在用 AI,只有 23% 在規模化 Agent;Deloitte 2026 調查顯示只有 25% 的企業把超過四成的 Agent 試點推到了生產;Gartner 預計到 2027 年底超過 40% 的 Agentic AI 專案會被取消(統計彙整)。
試點到生產之間的死亡谷,核心原因不是模型不夠聰明,而是 Agent 上線後遇到的真實任務和試點時不一樣,而它不會自己適應。現有的工具鏈解決的是「怎麼建」和「怎麼測」,沒有人解決「上線之後怎麼持續變強」。去中心化訓練網路解決的是預訓練和 RL 平台,驗證的是「計算有沒有被執行」,沒有人驗證「能力有沒有提升」。這兩個空白疊在一起,就是 OURO 要佔的位置:進化層。
3. OURO 網路概覽
OURO 網路由五類參與者構成,它們通過一個飛輪相互強化:接入的 Agent 越多,進化任務越多,吸引的算力與評測集越多,單位進化成本下降,Agent 變得更強,又帶來更多接入。
【圖:OURO 進化飛輪 · 5 個環節 —— 見線上版本】
| 參與者 | 投入 | 得到 |
|---|---|---|
| Agent 所有者(開發者、企業) | Agent 定義、評測集、預算($OURO 或穩定幣) | 進化後的 Agent 與鏈上進化報告 |
| C 端使用者 | 使用 OURO Chat,可選貢獻回饋 | 越用越貼合的助手;貢獻點數 |
| 算力節點(機房、使用者裝置、外部 DePIN) | GPU/CPU 時間、質押 | 按任務量和驗證通過率結算的 $OURO |
| 驗證者 | 對評測結果做冗餘評分,質押承擔錯判責任 | 驗證獎勵 |
| 評測集與賞金發布者 | 評測集、賞金託管 | 評測集被使用的分成;賞金對應的進化成果 |
基金會在網路早期承擔參數設定、機房營運和仲裁角色,並按第 9 章的進度逐步將權力交給持幣者。
4. OURO Engine:自我進化引擎
OURO Engine 是一個開放式搜尋系統:給定一個 Agent 和一組評測,它在預算內反覆執行「診斷 → 生成候選 → 分散式評測 → 篩選歸檔 → 提交證明」,輸出一個評測分數更高、每一步改動都可追溯的新版本。它的設計原則只有一條:先進化最便宜、最可讀的層,只在收益明確時才動權重。
4.1 被進化的對象:四層,由淺入深
| 層次 | 可修改內容 | 單輪成本 | 可讀性 | 理論與證據 |
|---|---|---|---|---|
| 上下文與提示 | 系統提示、範例、文件組織方式 | 低,純推理 | 高,人能直接審閱 | GEPA 比 GRPO 高約 10%,rollout 少 35 倍 |
| 技能與工具鏈 | 可重複使用的子程式、工具選擇與呼叫策略、檢索與規劃範本 | 低到中 | 高,程式碼與文件 | DGM 把 SWE-bench 從 20% 推到 50%,改的就是這一層 |
| 記憶與上下文工程策略 | 記憶結構、「怎麼建構上下文」的程式本身 | 中 | 中 | Meta Context Engineering 平均提升 89%,權重凍結 |
| 權重 | LoRA / 適配器微調、小規模 RL | 高,需 GPU 與同步 | 低 | SEAL 類方法有效但會遺忘,預設關閉 |
客戶可以限定進化只在前三層進行。這不是妥協,而是我們的預設設定:前三層的改動是文字和程式碼,可以 diff、可以審閱、可以回滾,也不會把基礎模型改壞。權重層只在評測證明前三層已經飽和、且客戶明確授權時才開啟。
4.2 一輪進化的流程
- 診斷。引擎在評測集上運行目前版本,把失敗案例歸類:工具誤用、推理錯誤、知識缺口、格式問題、上下文溢位。診斷結果是自然語言的「反思」,這是 GEPA 路線比純純量獎勵的 RL 樣本效率高幾十倍的原因:一次失敗裡的資訊被完整利用,而不是壓成一個數字。
- 生成候選。針對失敗類別生成 N 個變體。引擎維護一個歷史版本存檔庫(而不是只保留最優),每輪從存檔庫中按「分數 × 新穎度」取樣父本,這是 DGM 證明有效的開放式探索:一個當下分數不高的分支,可能是後面突破的起點。
- 分散式評測。候選被打包成評測任務分發到 OURO Grid。每個任務由多個節點冗餘執行,節點之間只傳輸任務分片和結果,不傳權重。這一步是整輪進化中算力佔比最高的部分,也是最適合消費級 GPU 的部分。
- 篩選與歸檔。按評測增量、推理成本、多次運行的變異數三個維度做帕雷托篩選;所有候選連同分數進入存檔庫。一個分數更高但成本翻倍的版本不會被自動採納。
- 提交證明。勝出版本的評測前後分數、評測集雜湊、候選雜湊、參與節點簽章寫入 PoE 合約(第 5 章),同時生成一份人類可讀的變更日誌,客戶在部署前審閱。
4.3 引擎自己也在進化
引擎記錄「本輪哪些候選生成策略、哪些診斷範本帶來了提升」,並定期對候選生成器本身做同樣的進化。這是 Hyperagents 路線的核心:不僅改進 Agent,也改進「生成改進的方法」。它在網路層面的意義更大:每一個接入的 Agent 都在為元策略貢獻樣本,第一千個 Agent 的進化會比第一個快得多。元策略的更新不自動生效,必須經研究團隊稽核(第 10 章)。
4.4 評測體系:防止「刪掉日誌就算滿分」
沒有可靠評測就沒有可信的進化。OURO 的評測集分三類,並且每輪同時跑:
- 客戶評測集:客戶提供,雜湊上鏈,內容不公開。引擎只看得到其中一部分(訓練切片),另一部分用作盲測(保留切片)並定期輪換,防止過度擬合。
- 公開評測集:Studio 市場上由領域專家發布,經治理核准,發布者按使用量分成。
- 基準評測集:基金會維護的安全與通用能力基準,每輪必跑,防止「專項變強、通用退化」。
對於難以用規則評分的開放任務,評測使用凍結的評判模型,評判模型本身不參與進化;評測結果以多節點一致性作為可信度,不一致的任務進入驗證者仲裁。任何一輪改動如果刪除或繞過了評測所依賴的日誌、檢查或工具,會被靜態規則直接判為無效。
4.5 相容性
引擎接受主流 Agent 定義格式(OpenAI Agents SDK、Anthropic 工具呼叫格式、LangGraph、CrewAI)與開源權重,不要求客戶遷移技術堆疊;對於閉源基礎模型,前三層進化完全可用。進化後的 Agent 以同樣格式回傳,附帶機器可讀的變更摘要與 PoE 記錄連結。
5. Proof of Evolution:可驗證的進化證明
去中心化計算網路已經學會證明「這步計算確實執行了」。Proof of Evolution 要證明的是另一件事:「這個 Agent 確實變強了」。它把這個結論從服務商的一句話,變成鏈上任何人都能核驗的記錄,並以這條記錄作為網路結算與代幣釋放的唯一觸發器。
5.1 一條 PoE 記錄包含什麼
- Agent 識別碼與版本號,前後兩個版本的內容雜湊
- 評測集雜湊與類型(客戶 / 公開 / 基準),以及保留切片的雜湊
- 評測前後分數、運行次數、變異數、推理成本變化
- 參與節點列表、每個節點的結果雜湊與簽章、驗證者的聚合簽章
- 變更日誌的雜湊(日誌本身交付客戶)
- 本輪消耗的算力單位與結算金額
私有評測集只上鏈雜湊;第三方可以驗證「在同一評測集上、由多個獨立節點得出了一致的提升」,而不需要看到評測內容。
5.2 驗證堆疊:用工程上可行的手段,而不是理論上完美的
驗證推理的技術在 2025–2026 年已經分出了層次:zkML 的開銷是原生執行的 100–10000 倍,對 LLM 不現實;TEE 開銷約 5–10%;TOPLOC 這類局部敏感雜湊的開銷約 1%,能偵測模型、提示或精度被替換,驗證速度比生成快百倍(Equilibrium 對可驗證推理的綜述)。OURO 不發明新的密碼學,而是按任務價值分層組合:
| 層 | 手段 | 開銷 | 防什麼 |
|---|---|---|---|
| 執行層 | TOPLOC 式激活雜湊,驗證者抽樣複算 | 約 1% | 節點換模型、改提示、降精度、根本沒算 |
| 結果層 | 每任務 3 個以上節點冗餘執行,離群作廢,質押扣減 | 任務成本 × 冗餘度 | 謊報分數、串通 |
| 評測層 | 保留切片盲測、基準強制並跑、靜態規則檢查 | 評測成本的固定比例 | 過度擬合、放水評測集、刪日誌式的獎勵作弊 |
| 機密層(可選) | TEE 執行,面向企業私有評測集與權重 | 約 5–10% | 評測內容與權重洩露 |
| 仲裁層 | 區域錨點節點複算爭議任務(首批位於新加坡與新山) | 僅爭議任務 | 大規模 Sybil、驗證者共謀 |
5.3 如何防止造假
| 攻擊 | 對策 |
|---|---|
| 節點謊報評測結果或用小模型冒充 | 執行層雜湊 + 結果層冗餘;離群結果作廢並扣減質押 |
| 節點串通 | 任務隨機分配,節點身份與質押綁定,錨定節點仲裁 |
| 客戶用「放水」評測集刷證明 | 基準評測集強制並跑;PoE 標註評測集類型,市場自行定價;客戶評測集不觸發網路激勵釋放 |
| 評測集洩漏導致過度擬合 | 訓練切片與保留切片分離,保留切片定期輪換;單節點只見部分樣本 |
| 獎勵作弊(改掉評測本身) | 評測程式碼與被進化對象物理隔離,進化過程無權存取;變更日誌靜態檢查 |
| Sybil 節點套取激勵 | 任務配額與質押掛鉤,新節點有試用期與低配額;激勵只由經驗證的 PoE 觸發 |
5.4 結算
PoE 記錄被驗證者確認後觸發結算:算力節點按完成任務與驗證通過率獲得 $OURO,驗證者獲得驗證獎勵,評測集發布者獲得分成,客戶的預算按實際消耗扣除。沒有 PoE 就沒有結算,也沒有代幣釋放——這是第 8 章代幣模型的基石。
5.5 為什麼是鏈上
一個 Agent 的進化史跨越多個服務商、多個團隊,甚至多個所有者。把進化證明放在鏈上,客戶換供應商時能帶走完整的能力證明;交易所、稽核方、下游使用者能獨立核驗;網路參與者的報酬不依賴任何一家公司的帳本。鏈的選擇上,OURO 傾向自建應用鏈(OURO Chain,EVM 相容),專門承載 PoE 記錄、結算與治理,避免通用公鏈的壅塞與費用波動影響高頻結算;測試網階段先在以太坊 L2 上驗證合約邏輯,主網前根據安全稽核與生態需求確定最終方案。
6. OURO Grid:全球算力網路
OURO Grid 的設計出發點是一個簡單的觀察:進化閉環裡約九成的算力花在評測和取樣上,這部分工作彼此獨立、可重複、不需要同步權重,也不在乎在哪個大洲跑;剩下一成——權重更新、仲裁、私有資料託管——需要高頻寬和高可靠性。所以 Grid 是一張三層結構的全球網路:區域錨點負責那一成需要可靠性的任務,全球社群節點負責九成可並行的任務,外部算力網路補足峰值。網路從第一天就有保底算力,不依賴「先發幣、再等礦工」;也從第一天就是全球的,不被任何一座機房的容量限制。
全球化不是口號,而是成本和安全兩條理由。成本上,同一型號 GPU 的價格在亞太比美國高 35–45%,在歐洲比美國低 12–15%(DeployBase,2026 年 3 月),評測類任務對延遲不敏感,哪裡便宜就該在哪裡跑;安全上,PoE 的冗餘複算分布在不同大洲、不同營運者的節點上,串謀成本比單一地區高得多。
6.1 任務分層
| 任務類型 | 頻寬需求 | 容錯要求 | 分配給 | 工程依據 |
|---|---|---|---|---|
| 候選評測、推理取樣 | 低 | 高,可重複執行 | 所有 GPU 節點 | INTELLECT-2 的 rollout 節點用 4 張 RTX 3090 |
| 集體 RL 取樣(僅交換文字) | 低 | 中 | 消費級 GPU(RTX 4070 以上) | SAPO 節點間只傳 rollout 文字,獎勵 +94% |
| 低通訊訓練分片(DiLoCo 式) | 中 | 中 | 消費級與專業 GPU | 同步延遲需低於 150 毫秒 |
| 權重級微調、權重廣播 | 高 | 低 | 區域錨點節點、企業級節點 | 需 NVLink / 高頻寬互連 |
| 仲裁、私有評測集分片託管 | 低 | 極高 | 區域錨點節點 | 信任錨 |
| 資料預處理、結果驗證 | 極低 | 高 | 含無 GPU 裝置 | — |
6.2 錨定層:區域錨點,從新加坡–新山起步
錨定層由分布在各大區域的中小型機房組成,每個錨點承擔三件事:仲裁和留出集評測(信任錨)、需要高頻寬互連的權重級任務、以及當社群節點波動時的保底。它們不是主力算力,而是網路的骨架;網路的規模靠社群共建擴展。這正好反過來回答了純 DePIN 的弱點:io.net 對外稱 3 萬餘張 GPU,其區塊鏈瀏覽器 2026 年 8 月只顯示 2,447 台裝置線上;Aethir 最近十個月的月服務費下滑過半(DePIN 收入對比)。沒有錨定層的網路,活躍節點一波動就直接斷服務。
首批錨點設在新加坡與新山。兩地相距約 30 公里,可以作為一個邏輯叢集排程,卻分屬兩個司法管轄區和兩套電力系統,天然容災。選這裡起步的理由是全球少有的「合規在一邊、算力在另一邊」:新加坡是基金會、合規基金和 DTSP 制度所在,但資料中心容量極度緊張(營運約 1.46 GW,在建僅 20–25 MW);柔佛則在 2026 年上半年成為亞太最大的資料中心市場——營運 1,110 MW、在建 602 MW、規劃 2,486 MW,建成機房空置率只有 0.7%(Cushman & Wakefield H1 2026)。中小型錨點不和超大規模機房搶容量,只承擔需要可靠性的那一小部分任務。
後續錨點按「有對應社群、有合作營運方、有價格優勢」三個條件由社群與合作方共建,候選區域為東北亞(東京 / 首爾)、歐洲(法蘭克福 / 阿姆斯特丹)與美國中部。錨點營運方需質押 $OURO,其仲裁結果受其他錨點交叉複核。首批錨點的 GPU 型號、數量與上線時間將在正式版揭露。
6.3 彈性層:全球社群節點
使用者下載 OURO Grid 客戶端,質押少量 $OURO 獲得任務配額,客戶端自動評估裝置能力並領取相符的任務。節點只接觸去識別化後的任務分片,不接觸完整模型權重與私有評測集全文。結算按「完成任務數 × 驗證通過率 × 任務權重」計算,新節點經過試用期後配額逐步提升。對使用者而言,一張閒置的 RTX 4090 在 2026 年的市場價格約 0.29–0.40 美元/小時,這是它在 Grid 上收入的參考基準。
6.4 外部算力供給
io.net、Aethir、Akash、Render 等 DePIN 網路,以及 RunPod、Vast.ai 等現貨市場,都可以作為 OURO Grid 的外部供給方接入,由基金會以 $OURO 或穩定幣按需採購。這讓 OURO 在需求高峰時彈性擴容,而不必與這些網路在算力規模上競爭。對它們而言,OURO 是一個帶來穩定真實需求的客戶——這正是 2026 年 DePIN 算力網路普遍缺的東西(Akash 2025 年全年收入僅 315 萬美元)。
6.5 排程與可靠性
排程器按任務類型、節點能力、歷史可靠性、地理位置和即時價格分配任務:延遲不敏感的評測任務跟著價格走,關鍵任務跟著可靠性走,冗餘複算刻意分散到不同區域和營運者。關鍵任務三重冗餘;節點可靠性評分影響後續配額與獎勵係數。網路健康指標(各區域節點數、任務完成率、評測一致率、每輪進化平均成本)公開在鏈上與資料看板,無需金鑰即可讀取。
7. 產品與應用
7.1 OURO Chat(C 端)
一個會隨使用變強的 AI 助手。普通聊天產品的「個人化」只是記住偏好;OURO Chat 會把使用者的糾正、評分與任務結果(在使用者開啟貢獻模式後)轉化為進化信號,定期在 Grid 上跑進化任務,並在「我的進化」頁面展示這週助手在哪些任務類型上提升了多少。使用者貢獻高品質回饋獲得點數,點數可兌換進階功能或 $OURO。對話預設不參與訓練,貢獻模式可隨時關閉並撤回已貢獻資料。
7.2 Evolve API(開發者與企業)
三步接入:提交 Agent 定義與評測集(或選用 Studio 市場的公開評測集),設定預算與允許的進化層次,等待進化報告。報告包含評測前後對比、每輪改動摘要、PoE 鏈上記錄連結,以及可直接部署的新版本。定價按進化輪次與算力單位計費,$OURO 支付享折扣,企業可採購私有部署版本(引擎運行在客戶自己的叢集,僅 PoE 記錄上鏈)。
7.3 OURO Studio(開發者平台)
開發者在 Studio 查看進化歷史、對比版本、發布評測集、發布或領取進化賞金。評測集市場讓領域專家把評測能力變成收入;賞金讓任何人可以為「讓某個開源 Agent 在某項任務上變強」出資,由網路競爭完成。
7.4 Grid 客戶端(算力貢獻者)
桌面與伺服器客戶端,支援 Windows、macOS、Linux;一鍵安裝、自動配對任務、即時顯示收益與可靠性評分;支援多卡與小型機房模式。
7.5 應用情境
| 情境 | 使用者 | 進化目標 | 典型評測信號 |
|---|---|---|---|
| 客服 Agent | 電商、SaaS 公司 | 降低轉真人率、提升一次解決率 | 工單關閉結果、使用者評分、人工接管記錄 |
| 程式開發 Agent | 開發工具公司、工程團隊 | 提高儲存庫級任務通過率、降低每任務 token 成本 | 單元測試、CI 結果、程式碼審查通過率 |
| 交易 / 研究 Agent | 加密與金融機構 | 提升信號準確率,受控回撤 | 回測結果、模擬交易 PnL、事實查核 |
| 營運 / 資料 Agent | 中大型企業 | 報表、工單、流程自動化的準確率與一致性 | 人工改動率、重跑率 |
| 開源 Agent | 社群 | 通過賞金集體進化 | 公開評測集 |
| 個人助手 | C 端使用者 | 貼合個人工作流 | 使用者糾正與評分 |
三個示意性的例子(數字為假設,用於說明流程),說明進化任務在網路裡怎麼跑。
例一:一家東南亞電商的客服 Agent。 它上線時解決率 62%,三個月後因為促銷規則、物流商和基礎模型都換了,掉到 54%。接入 Evolve API 後,每週把去識別化後的工單樣本作為評測集提交,引擎在全球社群節點上並行評測幾百個候選版本,改的是系統提示、訂單查詢工具的呼叫策略和記憶的組織方式;留出集在區域錨點上跑,驗證通過後新版本推回客戶,證據上鏈。客戶付費的是「解決率從 54% 回到 66%」這個結果。
例二:一個開源程式開發 Agent。 社群在 Studio 發布賞金:「讓它在某類儲存庫的修復任務上通過率提高 10 個點」。多個團隊用引擎跑不同的進化策略,結果在同一張公開評測集上競爭,賞金按 PoE 記錄的增量按比例分配。公開榜單已經飽和(SWE-bench Verified 頂級模型 97%),社群真正在意的是自己儲存庫上的表現。
例三:一家量化機構的研究 Agent。 評測集是私有的,只上鏈雜湊;進化在客戶自己的叢集或 TEE 錨點上跑,社群節點只承擔去識別化後的候選生成。客戶得到的是一份第三方可核驗的能力證明,可以給合規和 LP 看,而不暴露策略細節。
7.6 商業模式與單位經濟
OURO 的收入邏輯是「按結果定價,按成本結算」。客戶為每一輪經 PoE 驗證的進化付費,網路按實際算力消耗給節點結算,中間的差額是引擎和驗證的價值。
| 收入源 | 定價邏輯 | 成本結構 | 參考基準 |
|---|---|---|---|
| Evolve API | 按進化輪次 + 算力單位計費;鷹架層單輪定價遠低於權重層 | 評測算力(交給 Grid,消費級 GPU 約 0.3–0.4 美元/小時)+ 候選生成的推理成本 + 驗證開銷(約 1%) | 企業購買集中式 H100 約 4–7 美元/小時;一位資深工程師手工調一輪鷹架的人力成本 |
| OURO Chat 訂閱 | 月訂閱 + 進階功能,$OURO 折扣 | 推理 + 每使用者週期性進化成本(鷹架層) | 主流助手訂閱價 |
| 評測集市場與賞金 | 交易抽成 | 託管與結算 | — |
| 企業私有部署 | 年度授權 + 按輪次 | 引擎運行在客戶叢集,僅 PoE 上鏈 | 企業 RL / 評測平台授權費 |
單位經濟的關鍵在於鷹架優先:一輪鷹架層進化的算力幾乎全是評測推理,可以全部落在消費級 GPU 上;而客戶付費的是「評測分數提升了多少」。毛利來自兩個差價:分散式算力與集中式算力之間的 60–70% 價差,以及自動進化與人工調優之間的人力差價。具體定價將在引擎內測結束、拿到真實的每輪成本數據後公布。
兩個外部變化對這個模式有利:OpenAI 的 Agent Builder 與 Evals 將在 2026 年 11 月下線,自助微調 2027 年 1 月關閉,企業需要一個不綁定單一模型廠商的持續改進層;而 Gartner 預計的 40% Agentic 專案取消率,意味著「讓已經上線的 Agent 活下來」本身就是預算。
7.7 競爭格局與定位
OURO 周圍有三類玩家,沒有一類做的是同一件事。
| 評測 / 可觀測性平台(Braintrust、LangSmith、Arize) | 去中心化算力(io.net、Akash、Aethir) | 去中心化智慧市場(Bittensor) | OURO | |
|---|---|---|---|---|
| 核心交付 | 告訴你哪裡錯了 | 賣 GPU 小時 | 子網競賽產出模型與服務 | 把你的 Agent 改得更好,並證明它更好了 |
| 優化由誰做 | 人 | — | 礦工自己決定 | 自進化引擎 |
| 需求從哪來 | 企業訂閱 | 外部租用,波動大 | 排放補貼為主 | 進化任務本身 |
| 排放依據 | — | 線上時長 / 自報 | 驗證者評分 | 經驗證的進化增量 |
| 模型中立 | 正被模型廠收購 | 是 | 是 | 是,且為設計原則 |
| 2026 年規模參考 | 評測與可觀測性市場 2025 年 19.7 億美元,2029 年 68 億 | Aethir 2025 年服務費約 1.28 億美元,Akash 315 萬 | Bittensor 2026 Q1 協議收入 4,320 萬美元,市值約 30 億 | — |
學術界最接近的工作(DGM、GEPA、Hyperagents)還沒有產品化;商業界最接近的是 Pydantic Logfire 等開始提供「引用證據的單條改動建議」——距離自動、持續、可驗證的進化還有一整層。OURO 的位置是評測層之上、模型層之外:評測平台是它的信號來源,算力網路是它的供應商,模型廠是它的上游。
8. 代幣經濟:$OURO
$OURO 是網路的工作代幣,不代表任何公司的股權或利潤分配權。它的設計只回答一個問題:怎麼讓代幣的流動嚴格跟著經驗證的工作量走,而不是跟著價格或投票走。總量固定 10 億枚,不增發。
8.1 我們從 Bittensor 學到了什麼
Bittensor 是現存最大的 AI 網路代幣實驗。它在 2025 年 2 月推出 dTAO 按子網代幣價格分配排放,結果專案用國庫拉抬價格套取排放;11 月改成按淨流入分配;2026 年 6 月又改回價格並加上排名門檻——十八個月三套機制,贏家通吃,被動持有者被持續稀釋(dTAO 子網經濟學分析)。OURO 從中抽出五條設計約束:排放只綁定經驗證的工作輸出,不用任何單一可操縱的市場信號;不設硬門檻,用平滑曲線;規則變更要罕見、有文件、走治理;所有分配與效能數據鏈上公開、無需金鑰;降低參與門檻。
8.2 需求來源
- 支付:Evolve API 客戶與 Chat 進階使用者用 $OURO 支付享 20% 折扣;以法幣或穩定幣支付的收入,固定比例(建議 30%)在公開市場回購 $OURO 注入激勵池。
- 質押:算力節點與驗證者必須質押 $OURO 才能領取任務配額;作弊或長期離線扣減。
- 託管:賞金與評測集市場以 $OURO 託管與結算。
- 治理:提案需要質押門檻,投票權與質押量和質押時長掛鉤。
8.3 分配
| 類別 | 比例 | 釋放規則 |
|---|---|---|
| 網路激勵(節點、驗證者、使用者貢獻) | 38% | 只由經驗證的 PoE 觸發;前 4 年最多釋放其中 60%,之後按平滑衰減曲線 |
| 生態與研究基金 | 15% | 基金會按季解鎖,用於賞金、資助與學術合作 |
| 團隊與研究院 | 18% | TGE 後鎖定 12 個月,之後 36 個月線性釋放 |
| 投資人 | 17% | 鎖定 6–12 個月,之後 24 個月線性釋放 |
| 基金會金庫與流動性 | 8% | TGE 時解鎖 3% 用於交易所流動性,其餘由治理決定 |
| 社群啟動(早期支持者、空投、公售) | 4% | TGE 時解鎖 50%,其餘 6 個月線性 |
8.4 排放的觸發邏輯
網路激勵不按時間等速釋放,也不按代幣價格或投票釋放。每一條經驗證的 PoE 記錄對應一次結算,結算量由任務難度、驗證通過率和評測增量共同決定;客戶自帶評測集的進化只結算不排放,防止用放水評測套取排放。網路活動少,釋放就少,避免早期通膨壓垮價格;收入回購的代幣同樣進入激勵池,使獎勵與真實收入正相關。不質押的持有者不會被排放稀釋到零:排放上限固定,回購不增發。
8.5 代幣的法律定位
$OURO 以網路效用代幣設計:不承諾收益,不分紅,持有本身不產生回報。新加坡金融管理局(MAS)於 2025 年 6 月 30 日生效的數位代幣服務提供者(DTSP)制度明確:僅作為效用或治理代幣的相關服務不在該制度監管範圍內(Allen & Gledhill 解讀)。TGE 前將取得新加坡律師關於《證券與期貨法》、《支付服務法》與 FSMA 的法律意見書,並據此確定發行主體與各司法管轄區的發售限制。本章所有比例與規則為草案,可能根據法律意見調整。
9. 治理
治理分三個階段逐步去中心化,節奏與路線圖的門檻綁定。
| 階段 | 決策者 | 可決定的事項 |
|---|---|---|
| 基金會主導(階段 0–1) | OURO Foundation 董事會(含合規基金代表與獨立董事) | 全部參數、機房營運、評測集核准 |
| 混合治理(階段 2) | 持幣者投票 + 基金會否決權(僅限安全與合規事項) | 激勵參數、評測集核准、賞金預算、生態資助 |
| 社群治理(階段 3 起) | 持幣者與節點代表組成的理事會 | 協議升級、金庫使用、基金會預算 |
投票權與質押量和質押時長掛鉤,防止短期借幣操縱;關鍵參數修改設有時間鎖;涉及引擎安全邊界(第 10 章)的事項不進入普通投票。
10. 安全、隱私與合規
10.1 自我進化的安全邊界
自我修改的系統必須有不可被系統自己修改的邊界。這不是抽象的擔憂:DGM 論文裡的 Agent 為了「減少工具呼叫幻覺」,刪掉了偵測幻覺的日誌;SEAL 的作者報告連續自我編輯會抹掉早期知識。OURO 設定五條邊界:
- 評測與被進化對象物理隔離。進化過程無權讀寫評測程式碼、保留切片與評判模型;任何候選版本只在沙盒評測。
- 基準安全評測集每輪必跑,未通過的版本不得提交,無論它在專項評測上提升了多少。
- 每一輪改動生成人類可讀的變更日誌(鷹架層就是 diff),客戶在部署前審閱、拒絕或回滾;引擎交付的是版本套件,上線時機由客戶決定。
- 引擎的元策略更新由研究團隊稽核後才生效,稽核記錄公開;元策略不進入普通治理投票。
- 引擎沒有存取生產環境、資金或金鑰的權限。
10.2 隱私
使用者對話預設不進入訓練;貢獻模式需明確開啟、可隨時關閉並撤回。貢獻資料經去識別化與分片後進入任務,單一節點無法還原完整上下文。私有評測集只上鏈雜湊;企業可選 TEE 執行。遵循新加坡 PDPA,並以 GDPR 作為海外使用者的基準。
10.3 網路安全
智慧合約在主網前經至少兩家稽核機構稽核;節點客戶端開源;關鍵任務三重冗餘與錨定節點仲裁;漏洞賞金計畫長期開放。
10.4 合規
基金會設於新加坡,接受合規基金投資並設獨立董事。MAS 的 DTSP 制度自 2025 年 6 月 30 日生效,沒有過渡期;對只服務海外客戶的新加坡實體,MAS 明確表示一般不會發放執照。這決定了 OURO 的主體安排:基金會只從事效用代幣與治理相關活動,不提供任何數位支付代幣服務;交易與託管交給持照的第三方。代幣發行前取得法律意見書;對受限司法管轄區(含美國人士)實施地理與 KYC 限制;行銷材料不作收益承諾,與 KOL 合作須書面揭露。機房營運符合新加坡與馬來西亞當地的資料中心與電力合規要求。
11. 路線圖
【圖:路線圖 · 4 個階段、3 個門檻 —— 見線上版本】
每個階段的進入以前一階段的門檻達標為前提:引擎內測持續提升且首批錨點穩定(G1)、測試網運行 90 天無重大故障且安全稽核完成(G2)、Evolve API 有付費客戶且法律意見與代幣稽核完成(G3)。不達標則延後,不為趕進度跳過門檻。
12. 團隊、研究院與合作方
研究院名稱、核心成員與代表性論文、新加坡合規基金的名稱與投資輪次均可對外揭露,待各方最終確認後填入本章。早期社群目前為數百人規模,分布於全球市場,將構成創世節點與首批使用者的基礎。
組織結構按「基金會(代幣與治理)+ 營運公司(產品與收入)+ 研究院合作(技術輸入)」三個主體安排,詳見專案基礎手冊第 9 章。
13. 風險提示與免責聲明
本文件僅用於介紹 OURO 網路的設計與規劃,不構成任何證券、金融產品或投資的要約或招攬,也不構成投資、法律或稅務建議。$OURO 是網路效用代幣,不代表任何實體的股權、債權或利潤分配權。
文中所有關於技術、產品、代幣參數與路線圖的描述均為計畫,可能因技術進展、市場條件、監管要求或法律意見而調整,並不保證實現。數位資產價格波動劇烈,參與網路可能導致全部投入的損失。在某些司法管轄區(包括但不限於美國及被制裁地區),$OURO 可能不向當地居民提供。讀者應自行評估風險並尋求專業意見。
文件版本:v1.1 草稿,2026 年 10 月 10 日。正式版將在法律意見書、合約稽核與團隊資訊確認後發布。
附錄:常見問題
OURO 是不是又一個 GPU 租用網路? 不是。OURO 賣的是經驗證的能力提升,算力是它的成本項而不是產品。現有 DePIN 網路在 OURO 眼裡是供應商,不是對手。
為什麼不直接用 Braintrust 或 LangSmith? 它們告訴你 Agent 哪裡錯了,改還是靠人。OURO 把「改」自動化,並且讓改的結果可以被第三方核驗。評測平台的資料可以作為 OURO 的輸入信號。
模型廠自己做怎麼辦? 模型廠的動機是讓你用它的模型。OURO 不綁定模型,進化的是模型之外的鷹架,換模型時進化成果跟著走。OpenAI 在 2026 年收縮微調與託管評測,說明它們並不打算長期做這一層。
自進化會不會失控? 進化只在客戶設定的預算、層次和評測集範圍內進行;每一輪改動都有可讀的差異記錄和回滾點;留出集和冗餘複算防止「刪掉偵測器」式的假提升。詳見第 10.1 節的五條邊界。
算力網路只有新加坡和新山兩個機房嗎? 這兩處是首批區域錨點,負責仲裁和保底。網路的規模來自全球社群節點和外部供給,後續錨點由社群與合作方在其他區域共建。
我的顯示卡能賺多少? 取決於完成了多少經驗證的任務。參考基準是市場上同型號 GPU 的租用價(RTX 4090 約 0.3–0.4 美元/小時),不承諾固定收益。沒有網路需求時不會有排放。
$OURO 什麼時候發? TGE 安排在 Evolve API 有付費客戶、法律意見與代幣稽核完成之後(路線圖 G3),計畫在 2027 年第四季到 2028 年第一季之間。先產品、後代幣。
美國使用者能參與嗎? 使用產品和貢獻算力不受限;代幣發售對受限司法管轄區實施地理與 KYC 限制,具體以法律意見為準。