エンジンのプライベートベータが始まったら、すべての進化ラウンドのレポートを非識別化してここに公開します。理由は単純です。OURO が売っているのは「検証可能な改善」であり、私たち自身の進化プロセスが非公開のままでは、その主張に重みがありません。
毎回、4 つの固定項目を書きます。 第一に、どんな種類の agent を進化させ、どんな評価セットを使ったか(種類と規模のみ。顧客名や内容は書きません)。第二に、前後のスコア、信頼区間、ホールドアウトの結果。第三に、エンジンが何を変えたか:どの層か、変更の要約、そして却下された候補が失敗した理由のうち最も興味深い 1 つか 2 つ。第四に、どれだけの計算資源と費用がかかり、どのノードで実行され、オンチェーンの PoE 記録はどこにあるか。
失敗も公開します。 向上のなかったラウンドや、ホールドアウトに失敗したラウンドも、そのまま公開します。DGM 論文に出てくる、システムが「ハルシネーション検出ログを削除した」ケースを私たちは常に念頭に置いています。進化するシステムで最も起こりやすい失敗は停滞ではなく、間違った方向に改善することです。失敗したラウンドを公開することで、コミュニティが評価そのものを一緒に見守れるようになります。
非識別化のルール。 顧客の身元、評価サンプルの原文、プロンプトの全文は公開しません。変更は要約と diff 統計で示します。オンチェーン記録自体に個人情報は含まれません。企業顧客はログから完全に除外されることを選べます。
最初の本物のエントリーは、2027 年 Q1 のプライベートベータ開始後に公開します。それまでは、この場所で方法論のノートを掲載します。良い評価セットの書き方、スキャフォールディング進化とファインチューニングの違い、そして Bittensor のインセンティブの教訓を私たちがどう読んでいるか。