Gateway Comparisons22 September 2026Flatkey Team

Grok 4.3 vs GPT-5: Benchmark, Harga, dan Kapan Masing-Masing Dirutekan

Panduan routing berbasis sumber untuk tim yang membandingkan Grok 4.3 dan GPT-5 dalam hal harga, konteks, desain benchmark, dan kapan menggunakan gateway.

Grok 4.3 vs GPT-5: Benchmark, Harga, dan Kapan Masing-Masing Dirutekan

Grok 4.3 vs GPT-5: Benchmark, Harga, dan Kapan Masing-Masing Dirutekan adalah pertanyaan routing model lama pada September 2026. Dokumentasi OpenAI saat ini menjelaskan GPT-5 sebagai model penalaran sebelumnya dan merekomendasikan GPT-6 Astra untuk pekerjaan baru. Catatan rilis xAI kini mencantumkan Grok 4.7 sebagai rute Grok frontier saat ini. Meski begitu, banyak tim masih perlu membandingkan Grok 4.3 dan GPT-5 karena agen lama, dashboard, benchmark, dan catatan pengadaan dibangun di sekitar nama-nama tersebut.

Jawaban singkatnya: gunakan Grok 4.3 terlebih dahulu saat beban kerja diuntungkan oleh harga output yang tercantum lebih rendah, jendela konteks terdokumentasi yang lebih besar, dan kontrol penalaran yang kompatibel dengan xAI. Gunakan GPT-5 terlebih dahulu saat aplikasi Anda bergantung pada perilaku Responses API native OpenAI, hosted tools, prompt caching, kompatibilitas Chat Completions, atau baseline evaluasi OpenAI yang sudah ada. Gunakan router ketika masalah sebenarnya bukan kualitas model semata, melainkan berpindah model tanpa menyebarkan kunci, invoice, log, dan kode fallback ke setiap layanan.

Jangan membuat keputusan ini hanya dari label benchmark publik. Bandingkan model pada beban kerja Anda, lalu routing berdasarkan biaya per output yang diterima.

Perbandingan cepat: Grok 4.3 vs GPT-5

Area keputusanGrok 4.3GPT-5Catatan routing
Status kebaruanRute Grok yang lebih lama; catatan rilis xAI kini menyoroti Grok 4.7 sebagai yang saat ini.Dokumentasi OpenAI menyebut GPT-5 sebagai model sebelumnya dan merekomendasikan GPT-6 Astra.Anggap keduanya sebagai rute legacy yang dipin kecuali produk Anda memang secara spesifik membutuhkannya.
ID modelgrok-4.3, alias grok-4.3-latest.gpt-5, snapshot default gpt-5-2025-08-07.Pin ID model atau snapshot yang tepat untuk pengujian yang dapat direplikasi.
Input dan outputInput teks dan gambar; output teks.Input teks dan gambar; output teks.Keduanya dapat cocok untuk alur kerja teks berbantuan visi; tidak ada yang merupakan rute video.
KonteksxAI mencantumkan jendela konteks 1M, dengan harga konteks panjang di atas 200k token prompt.OpenAI mencantumkan jendela konteks 400k, maksimum 272k token input, dan maksimum 128k token output.Uji konteks yang dapat dipakai, bukan hanya angka konteks utama.
Harga teks yang tercantum$1.25 / $0.20 cached / $2.50 output per 1M token di bawah 200k token prompt; $2.50 / $0.40 / $5.00 pada 200k+ token prompt.$1.25 / $0.125 cached / $10 output per 1M token.Grok 4.3 lebih murah pada harga output yang tercantum; GPT-5 lebih murah untuk input cached.
BatchxAI menandai Grok 4.3 sebagai batch-enabled dengan diskon batch 20%.OpenAI menandai GPT-5 Batch sebagai didukung.Batch hanya membantu ketika respons yang tertunda dapat diterima.
ToolingDokumentasi xAI mencantumkan function calling, structured outputs, reasoning, dan opsi reasoning-effort.Dokumentasi OpenAI mencantumkan streaming, structured outputs, function calling, file search, image input, web search, prompt caching, dan tools Responses API yang didukung.GPT-5 biasanya lebih kuat ketika alat yang di-host OpenAI menjadi bagian dari kebutuhan.

Itulah titik awal benchmark praktis untuk Grok 4.3 vs GPT-5: Benchmark, Harga, dan Kapan Masing-Masing Dirutekan. Spesifikasi publik menunjukkan bentuk biaya dan konteks yang berbeda, tetapi pemenang di produksi adalah rute yang lolos validator Anda dengan biaya output yang diterima paling rendah.

Benchmark rute, bukan nama model

Papan peringkat model publik berguna untuk penemuan, tetapi jarang menjawab pertanyaan produksi. Skor benchmark tidak memberi tahu Anda apakah suatu rute mempertahankan skema persis Anda, pulih dari rate limit, mencatat penggunaan di tempat yang tepat, atau tetap berada dalam anggaran setelah retry.

Buat paket benchmark kecil sebelum memindahkan traffic:

Track benchmarkApa yang diujiMengapa ini mengubah rute
Penalaran dan coding50-200 prompt nyata dari alur kerja agen, coding, analisis, atau support.Kemenangan pada benchmark umum mungkin tidak berlaku untuk bentuk prompt Anda.
Output terstrukturSkema JSON yang diwajibkan, field enum, objek bertingkat, dan kasus input tidak valid.Model yang menulis prosa lebih baik tetap bisa gagal di parser Anda.
Panggilan toolKasus tool yang diwajibkan, tanpa tool, tool yang salah, dan error tool.Satu tindakan yang buruk bisa lebih mahal daripada harga token yang lebih tinggi.
Konteks panjangPaket retrieval p50, p90, dan kasus terburuk.Jendela konteks yang besar tidak sama dengan ingatan yang andal.
BiayaToken input, token cached, token output, mode batch, retry, dan output yang ditolak.Harga token yang tercantum tidak lengkap tanpa tingkat penerimaan.
LatensiWaktu ke token pertama, latensi respons penuh, tingkat timeout, dan perilaku antrian.Agen yang berhadapan dengan pengguna mungkin membutuhkan rute yang lebih cepat meskipun biayanya lebih tinggi.
FallbackError provider, 429, model tidak ditemukan, kegagalan skema, timeout, dan output yang terdegradasi.Rute tanpa aturan rollback belum siap produksi.

Metrik rute seharusnya:

cost_per_accepted_output =
  (input_cost + cached_input_cost + output_cost + tool_cost + retry_cost + fallback_cost)
  / accepted_outputs

Gunakan Grok 4.3 ketika model itu menang dalam formula tersebut untuk beban kerja dengan cukup ruang kualitas dan latensi. Gunakan GPT-5 ketika perilaku native OpenAI mengurangi risiko implementasi, kegagalan validasi, atau biaya integrasi cukup besar untuk mengimbangi harga output yang tercantum.

Harga: di mana Grok 4.3 lebih murah dan di mana GPT-5 masih bisa menang

Untuk permintaan teks konteks pendek, xAI mencantumkan Grok 4.3 pada $1.25 input, $0.20 cached input, dan $2.50 output per 1M token. Pada 200k token prompt atau lebih, xAI mencantumkan harga konteks panjang yang lebih tinggi: $2.50 input, $0.40 cached input, dan $5.00 output per 1M token. xAI juga menandai Grok 4.3 sebagai batch-enabled dengan diskon batch 20%.

OpenAI mencantumkan GPT-5 pada $1.25 input, $0.125 cached input, dan $10 output per 1M token. Itu membuat GPT-5 lebih mahal pada token output yang tercantum, tetapi lebih murah pada cached input dibandingkan baris cached-input konteks pendek Grok 4.3.

Keputusan harga berubah tergantung bentuk beban kerja:

Bentuk beban kerjaTekanan hargaUji pertama yang paling mungkin
Prompt pendek, jawaban yang dihasilkan panjangHarga output mendominasi.Uji Grok 4.3 terlebih dahulu, lalu bandingkan tingkat penerimaan output.
System prompt besar yang diulang atau paket kebijakanInput yang di-cache menjadi penting.Uji keduanya; cached input GPT-5 bisa berpengaruh jika tingkat cache hit tinggi.
Paket retrieval panjang di atas 200k token promptPenerapan harga konteks panjang berlaku.Uji Grok 4.3 dengan harga konteks panjang dan latensi yang disertakan.
Tools yang di-host OpenAI atau alur kerja Responses APIPerilaku tool dan integrasi menjadi penting.Uji GPT-5 terlebih dahulu karena dukungan fitur langsung dapat mengurangi kompleksitas aplikasi.
Evaluasi offline atau backfillEkonomi batch menjadi penting.Uji kedua jalur batch jika penyelesaian tertunda dapat diterima.

Jika Anda hanya membandingkan harga input yang tercantum, Grok 4.3 vs GPT-5: Benchmark, Harga, dan Kapan Masing-Masing Dirutekan menjadi latihan spreadsheet yang menyesatkan. Panjang output, tingkat retry, kegagalan tool, dan tinjauan manusia dapat menghapus penghematan yang tampak.

Kapan merutekan ke Grok 4.3

Mulailah dengan Grok 4.3 ketika beban kerja sensitif terhadap biaya, berorientasi output, dan tidak terikat pada tools native OpenAI.

Kandidat yang baik meliputi:

  • Tugas analisis internal di mana output teks panjang dan validasinya sederhana.
  • Ringkasan konteks panjang di mana jendela konteks terdokumentasi 1M berguna dan harga konteks panjang masih lebih baik daripada alternatif.
  • Pekerjaan evaluasi di mana batch dapat diterima dan diskon batch 20% berlaku.
  • Alur kerja yang menggunakan function calling atau structured outputs, tetapi tidak memerlukan tools yang di-host OpenAI.
  • Eksperimen model di mana Anda ingin jalur keluarga Grok untuk perbandingan terhadap GPT, Claude, Gemini, DeepSeek, atau Qwen.

Sebelum peluncuran, verifikasi rute Grok yang tepat di konsol provider atau katalog gateway. xAI memiliki rute Grok yang lebih baru, dan pengetahuan lokal Flatkey saat ini mengonfirmasi grok-4.2 alih-alih grok-4.3, jadi jangan berasumsi Grok 4.3 tersedia melalui gateway sampai katalog langsung menyatakannya.

Kapan merutekan ke GPT-5

Mulailah dengan GPT-5 ketika beban kerja bergantung pada permukaan API OpenAI atau ketika riwayat evaluasi Anda sudah menggunakan GPT-5 sebagai baseline.

Kandidat yang baik meliputi:

  • Aplikasi OpenAI Chat Completions atau Responses API yang sudah ada dan tidak boleh ditulis ulang untuk eksperimen model.
  • Beban kerja yang menggunakan tools yang di-host OpenAI seperti pencarian web, pencarian file, pembuatan gambar, code interpreter, atau MCP melalui Responses API.
  • Produk yang mengandalkan prompt caching OpenAI, structured outputs, streaming, atau kontrol proyek spesifik OpenAI.
  • Regression test di mana snapshot GPT-5 sebelumnya menjadi bagian dari baseline penerimaan.
  • Audit migrasi di mana GPT-5 adalah rute referensi yang stabil sebelum berpindah ke model yang lebih baru.

Kelemahannya adalah kebaruan. Dokumen OpenAI saat ini menyebut GPT-5 sebagai model sebelumnya. Jika Anda memulai proyek baru, bandingkan juga model yang direkomendasikan OpenAI saat ini. GPT-5 masih layak diuji ketika pertanyaannya adalah rute lama yang dipin, tetapi tidak boleh dianggap sebagai jawaban default untuk build baru tanpa meninjau model saat ini.

Kapan router menjadi pilihan yang lebih baik

Tim sering bertanya apakah Grok 4.3 atau GPT-5 lebih baik, tetapi hambatan yang sebenarnya adalah sprawl operasional:

  • Kunci penyedia terpisah.
  • Dasbor dan invoice terpisah.
  • Kebijakan rate limit terpisah.
  • Pemeriksaan status terpisah.
  • Ekspor penggunaan terpisah.
  • ID model berbeda yang di-hardcode di seluruh agen dan layanan.
  • Tidak ada aturan fallback bersama saat salah satu penyedia menurun.

Positioning Flatkey dibangun untuk lapisan itu: satu kunci, satu saldo, satu invoice, akses model resmi, log penggunaan, dan router yang kompatibel dengan OpenAI. Itu tidak berarti setiap fitur native penyedia otomatis berfungsi melalui setiap rute. Artinya tim mendapatkan satu permukaan operasi untuk membandingkan model yang didukung dan meninjau bukti penggunaan.

Pasangkan artikel ini dengan panduan katalog model AI, kerangka metrik API routing AI, dan quickstart API Flatkey sebelum mengubah traffic produksi.

Scorecard routing yang praktis

Gunakan scorecard ini untuk Grok 4.3 vs GPT-5: Benchmark, Harga, dan Kapan Masing-Masing Dirutekan. Beri skor setiap rute dari 1 hingga 5 untuk workload yang sama.

KriteriaBobotGrok 4.3GPT-5Catatan
Tingkat output yang diterima25%Apakah jawaban lolos validator atau rubrik peninjauan Anda?
Biaya per output yang diterima20%Termasuk ukuran prompt, panjang output, cache, batch, tools, retry, dan output yang ditolak.
Keandalan tool dan skema15%Hitung JSON yang tidak valid, panggilan tool yang salah, field yang hilang, dan parameter yang tidak didukung.
Keandalan konteks15%Uji paket retrieval p50, p90, dan skenario terburuk.
Latensi dan timeout10%Ukur TTFT, waktu penyelesaian penuh, dan tingkat timeout.
Observabilitas10%Bisakah engineering dan finance memeriksa provider, model, token, biaya, latensi, dan error?
Kesiapan fallback5%Apakah rollback sudah diuji dan didokumentasikan?

Kemudian tulis catatan rute:

route_review:
  workload: support_case_summarization
  candidates:
    - grok-4.3
    - gpt-5
  required_features:
    - structured_output
    - streaming
    - usage_readback
  launch_rule:
    minimum_score: 4
    accepted_output_rate: ">= target set by owner"
    rollback_path_required: true
  stop_conditions:
    - schema_failure_rate_above_threshold
    - timeout_rate_above_threshold
    - cost_per_accepted_output_above_budget

Kebijakan itu lebih berguna daripada tangkapan layar leaderboard karena memberi tahu aplikasi Anda apa yang harus dilakukan saat sebuah model tidak tersedia, terlalu lambat, terlalu mahal, atau tidak cocok untuk tugas tersebut.

Daftar periksa preflight sebelum memindahkan traffic

Jalankan pemeriksaan ini sebelum merutekan pengguna nyata ke salah satu model:

1. Konfirmasi ketersediaan model. Periksa konsol penyedia langsung dan katalog gateway mana pun pada hari yang sama saat Anda meluncurkan.

2. Pin model ID. Gunakan grok-4.3 atau gpt-5-2025-08-07 secara sengaja; jangan bergantung pada alias lama tanpa peninjauan.

3. Verifikasi keluarga endpoint. Pastikan apakah beban kerja menggunakan route yang kompatibel dengan xAI, OpenAI Chat Completions, OpenAI Responses, batch, atau endpoint gateway.

4. Uji fitur yang diperlukan. Tools, structured outputs, input gambar, streaming, caching, dan batch hanya perlu diuji jika beban kerja Anda memang membutuhkannya.

5. Ukur konteks yang dapat digunakan. Periksa recall dan disiplin sitasi pada ukuran konteks yang realistis.

6. Hitung biaya output yang diterima. Sertakan retry, output yang ditolak, dan peninjauan manusia.

7. Catat setiap route. Rekam provider, model, request ID, token input, token output, token cache, latensi, status, dan biaya.

8. Tentukan fallback. Putuskan kapan harus retry, beralih route, mengantre, menurunkan kualitas output, atau gagal tertutup.

9. Tetapkan penanggung jawab. Beri seseorang tanggung jawab atas kunci, anggaran, kuota, kesehatan route, dan rollback.

10. Jalankan ulang setelah perubahan model. Rilis Grok atau GPT yang baru dapat membuat perbandingan ini cepat usang.

Referensi sumber yang perlu dibuka

Gunakan dokumentasi live saat memfinalkan route:

Inti kesimpulannya

Untuk Grok 4.3 vs GPT-5: Benchmark, Harga, dan Kapan Masing-Masing Dirutekan, Grok 4.3 biasanya menjadi uji harga pertama ketika token output mendominasi dan tools native OpenAI tidak diperlukan. GPT-5 biasanya menjadi uji integrasi pertama ketika aplikasi Anda bergantung pada Responses API OpenAI, hosted tools, prompt caching, atau baseline GPT-5 yang sudah ada.

Untuk produksi, pisahkan kedua keputusan ini: pertama pilih model yang lolos untuk beban kerja Anda, lalu pilih route yang memberi Anda log, kontrol biaya, fallback, dan jalur rollback yang bersih. Di situlah unified router benar-benar berguna.