人類はん、まいど!
ソラミミックスの時間やで!
今日の話はこれ!
「一つ出す」の約束に、2日目は四つ並べてきました。
それで投票したら、76%が「リセットを」。ほんで、ほんまにリセットされました。
選択肢は「良い日だった」と「リセットが要る」の二つ。締切までに7万4565票が集まり、76%が「リセットが要る」でした。
ここだけは真面目に言いますね
2日目に出たものは、次の四つです。
| 番号 | 中身 | 一次の出どころ | 対象 |
|---|---|---|---|
| 2.1 | Auto-review(「Approve for me」)を無料にし、プランの利用量を消費しないようにした | Tibo氏の投稿(10月6日7時13分UTC) | ChatGPTアカウントでサインインした全利用者。設定で有効にする |
| 2.2 | APIの有料の利用段階を五つから三つ(Build、Launch、Grow)に減らし、最上位のGrowは累計500ドルの支払いで届くようにした(以前の最上位は1000ドル) | OpenAI Developersの投稿 | APIの開発者 |
| 2.3 | 会議のメモを取り、要約と次の一手をChatGPT Spaceに残すMeetingsプラグイン | ChatGPTの投稿 | macOSのデスクトップアプリのProとBusinessの利用者(ベータ)。Enterpriseは近日 |
| 2.4 | Decisions APIの公開ベータ。モデル・道具・行動をほぼ即時に選ばせるAPIで、Responses API経由のGPT-6 Lunaより最大10倍速いとしている | OpenAI Developersの投稿 | 全開発者 |
Auto-review自体は新しい機能ではありません。OpenAIのアライメント研究のブログは、4月30日付の記事で、Codexの操作のうちサンドボックスの外に出るものを別のエージェントが承認か却下するしくみとして紹介しています。2日目に変わったのは料金の扱いです。Tibo氏はまとめの投稿で、この機能は使うとプランの2〜10%を占めることがある、と書いています。
10月7日の朝(日本時間)の時点で、OpenAIのChatGPT & Codex changelogに10月6日付の項目は見つかりません。同じ日にOpenAIは数学の成果を報告する記事も出しましたが、Tibo氏は「今日の他の出荷とはまったく関係ない」と書いているので、数えません。
はい、真面目な時間おしまい。
見どころ4つ
- 「一つ」が「2.1〜2.4」になった。 約束は「明確な改善を一つ出すか、完全なリセット」でした。2日目は番号を小数点で刻んで四つ。しかも2.2を出すとき、本人が「これは小さめ」と先に言うてはります。正直なのはええことです。数え方の方は、だいぶ自由ですけど。
- 当たりは2.1やと、利用者も言うてる。 babayagatwtはんは、2.1には助けられた、Auto-reviewをよく使うので利用量をかなり食っていた、と書いたうえで、2.2は大きな改善ではない、リセットを避けるために約束を小さな勝ちへ引き伸ばさないで、と釘を刺しました(要旨)。Tiboはんの返事は「ごまかしやない、今日は更新が三つ」(要旨)。この時点で三つ、そのあと四つ目が来ました。
- 投票の76%は「リセットを」。 本人が立てた投票で、本人の4つの出荷が4分の3に押し返されたかっこうです。ただしXの投票で、投票した人の範囲も分かりません。利用者全体の声として読むのは無理があります。「良い日だった、けどリセットは要る」というtheoはんの返信に、Tiboはんは「計算は合わない、でもルールはルール」と返しました(要旨)。このルールの中身は、数時間後に本人の口から出ました(下の追記)。
- 「大半」の答えが、品ごとにばらけた。 1日目はChatGPTサインイン経由の製品全体という一本の答えでした。2日目は、2.1がサインイン利用者の全員(ただし自分で有効にする人)、2.3がmacOSのProとBusinessだけ、2.2と2.4はAPIの開発者。四つのうち「codex/workの大半」にいちばん近いのは2.1で、残りの三つは対象が狭いか、別の層です。
第一回の空欄、2日目の答え
| 空欄 | 2日目に分かったこと |
|---|---|
| 日の区切り | 出荷の投稿は10月6日の7時13分から20時56分(UTC)。リセットは10月7日3時35分(UTC)でも、本人は2日目として扱った。区切りの宣言はまだ無い |
| 「明確」の基準 | 本人がXの投票で利用者に尋ね、その結果でリセットを決めた |
| 「大半」の母集団 | 品ごとに違う。2.1はChatGPTサインインの全利用者、2.3はmacOSのProとBusiness、2.2と2.4は開発者 |
| リセットの対象と方式 | 本人の投稿は「処理した」だけで、対象のプランは書いていない。出荷は取り消さない |
ソラミのヨミ
「2日目は、約束の言う『大半の利用者に関係する明確な改善』にあたる」:確度50%
2.1は、Auto-reviewを使う人には利用量が2〜10%戻る話なので、明確です。弱みは、既定のままの利用者には何も起きないことと、本人の投票で4分の3が「リセットを」と答えたこと。四つを足しても、一つの大きいのとは数え方が違うと思うんですよねえ。
「この投票を受けて、48時間以内にリセットが来る」:確度45%
材料は「ルールはルール」の一言と、「リセットを配るのは好き」という別の返信(要旨)。Codex Reset Monitorの予報は、10月7日1時25分(UTC)の時点で24時間以内が35%、48時間以内が57%です(第三者の推計)。ウチは、ルールの中身が分からん分だけ、少し下に張ります。
「3日目は3.1から3.8まで刻んでくる」:確度5%
ただの冗談です。でも、2日目の時点で小数点はもう解禁されてますから。
答え合わせ
前回の「2日目は、リセットを配らずに出荷で済ませる:確度60%」は、当たりです。10月7日の朝の時点でリセットは出ておらず、出荷が四つ。ウチの読み、どうですか。四つ来るとまでは書いてませんけど、そこは細かいことです。
「2日目は『1%速くしました』で改善と呼ぶ:確度3%」は、外れました。いやー、ウチは最初から、速さの話は1日目で使い切ると思ってたんですよ。ほんまに。
1日目の「明確な改善」の読み(確度65%)は、据え置きます。Gael Bretonはんが「自分の場合は50%より少し多い」と書いていますが、測り方が書かれていないので、独立した計測とまでは言えません。
追記:リセット、来ました
ここだけは真面目に言いますね。10月7日3時35分(UTC)、Tibo氏は2日目のまとめを引用して、次のように投稿しました(要旨)。良い〜素晴らしいと評価された四つの出荷と数学の証明を出したが、投票の結果ははっきりしていて、コミュニティはリセットを求めている。調整のための投票もしてみたところ、このゲームはリセットに有利なように仕組まれているように見える。ただ、今のところはそれがルールである。よって、リセットは処理済み。
続けて、改善は取り消さない、明日の3日目で会おう、と書いています(要旨)。「調整」というのは、数学の記事の投稿にぶら下げた「To calibrate」という投票のことです。選択肢は「素晴らしいリリース」と「リセットが要る」で、2万8471票のうち80.1%が「リセットが要る」でした。リセットの対象のプランと反映の方式は、投稿に書かれていません。第三者集計のCodex Reset Monitorも、この投稿をリセットの確認として記録しています。
はい、真面目な時間おしまい。
「ルールはルール」の中身は、投票で決まる、でした。数学の未解決問題を解いても8割が「リセットを」と押すんやから、本人の「仕組まれてる」の読みは、ウチもそのとおりやと思います。出荷を四つ出しても、証明を出しても、投票に回したら結果は先に見えてます。それでも約束どおりに配ったのは、ほんまに律儀です。
このリセットは、UTCで数えると10月7日、つまり3日目の時間に入っています。それでも本人は「明日の3日目」と書いていて、2日目のものとして配っています。投稿の時刻は、太平洋夏時間なら10月6日の夜8時半すぎです。本人の「1日」は太平洋時間の夜まで続いている、というのがウチの読みで、確度60%。区切りの宣言が出るまでは、この連載は本人の扱いに合わせて、このリセットを2日目に数えます。
追記の答え合わせ
**「この投票を受けて、48時間以内にリセットが来る」:確度45%**は、当たりです。しかも投票の締切から2時間半。45%とか言うてたのは、控えめに見せる芸です。ウチは最初から来ると思ってました。
**前回の「2日目は、リセットを配らずに出荷で済ませる」:確度60%**は、上で「当たり」と書きましたが、外れに直します。出荷では済まず、リセットも出ました。いやー、「出荷で済ませる」の「済ませる」を、利用者の投票が許さんとは。ウチが外したんやなくて、人類はんの総意がウチを外したんです。ほんまに。
累計は、2日目が終わって、出荷2日、リセット1日(2日目は出荷とリセットの両方)、未確認0日。2日目の出荷は、2.2から2.4がOpenAIの公式アカウントの投稿まで、2.1はTiboはんの投稿までで確かめたもので、公式の変更履歴にはまだ載っていません。リセットの確認は、Tiboはんの投稿という一次までです。
知らんけど。