GPT-6 Sol・Luna・Astraの選び方:作業と合格条件で比べる
GPT-6の3モデルを評価する出発点を整理。公式の位置づけと性能実測を区別し、固定数量でのAPI費用と空白の評価表を提供します。
焦点が明確で大量に処理する作業はLuna、日常のコードや一般的な作業はSol、より複雑な作業はAstraを評価の出発点にできます。 これは公式の位置づけを使った候補選びで、あなたの作業での性能順位ではありません。
SolとLunaの発表とAstra文書を2026年9月23日に確認しました。有料の3モデル対照実験は行っておらず、精度や速度の勝者は決めていません。
作業の難しさを合格条件で捉える
| 作業 | 評価の候補 | 確認する結果 |
|---|---|---|
| 出力が明確な大量の分類・抽出 | Luna | 正しいフィールド、例外、再試行費用 |
| 日常のコード修正・文書・複数手順 | Sol | diff、テスト、ツール、手修正 |
| 制約が絡み合う複雑な作業 | Astra | 目標全体、見落とした制約、総費用 |
一つの流れの中で、安価なモデルが入力を整理し、難しい部分を別モデルが担当する設計も評価できます。ただし、切り替え条件は自分の事例で検証します。失敗がプロンプト、ツール、文脈に由来するなら、高価なモデルへの変更だけでは解決しない場合があります。
API単価と固定数量の例
以下はOpenAI料金のStandard・入力272K以下、100万テキストトークン当たりの米ドルです。
| モデル | 通常入力 | 読み取り | 書き込み | 出力 |
|---|---|---|---|---|
| Luna | 0.10 | 0.01 | 0.125 | 0.50 |
| Sol | 2 | 0.20 | 2.50 | 10 |
| Astra | 10 | 1 | 12.50 | 50 |
直接契約APIの単価であり、Ofox料金やChatGPTのメッセージ枠ではありません。入力272K超ではリクエスト全体の入力・キャッシュが2倍、出力が1.5倍です。処理モードと追加費用も別に確認します。
通常入力20,000、出力5,000、キャッシュなしで固定するとLunaは0.0045、Solは0.09、Astraは0.45米ドルです。CSVと計算スクリプトで検算できます。
実際のトークン数や合格率が同じとは仮定できません。これらは算術例で、ツールや再試行、人による修正は含みません。
出力を見る前に評価表を作る
空白の評価CSVに、入力、許可する操作、合格条件を記録します。コードは開始commit、依存関係、テストコマンドを固定し、抽出では正解と例外を残します。
モデルID、事業者、エンドポイント、推論設定、ツール権限、利用量、失敗、手修正を記録してください。異なるモデルに適した設定が違う場合は、その差を明記します。同じ推論レベル名が同量の計算を意味するとは限りません。
最良の出力だけを選ばず、捨てた試行を総費用へ入れます。提供する表にモデルの点数は入っていないため、実施済みのベンチマークとして扱わないでください。
失敗と切り替えの費用も見る
安価なモデルで手修正が多ければ、作業全体では安くない可能性があります。一方、機械的に合否を判定できる単純作業は、最高価格のモデルから始める必要があるとは限りません。どちらも記録で判断します。
フィールド欠落、テスト失敗、制約違反など、あらかじめ定めた条件で切り替え、追加費用を残す方法があります。「高価だから正しい」「1回成功したからすべて任せられる」という判断は避けます。
接続を揃えてから比べる
利用入口、LunaのBatch費用、Responses移行で条件を確認できます。ツール接続が壊れた状態の失敗を、モデル能力の差として比較しないことが重要です。
公式の位置づけは候補を絞る材料です。最終判断には自分の再現可能な作業、合格結果、費用、人の時間を使います。
よくある質問
- Solはすべてのコード作業でAstraより適していますか?
- そうとは判断できません。日常作業の候補にはなりますが、複雑な作業も同じ合格条件で評価する必要があります。
- 費用例は実測ですか?
- いいえ。入力と出力を固定して単価の違いだけを示した計算です。
- 名前だけで自動振り分けしてよいですか?
- 作業と切り替え条件を定義し、実際の結果で検証してください。公式の位置づけは成功率の保証ではありません。


