Google Buka Era Baru AI, Gemini 4 Argon Hadir dengan Klaim Performa Terdepan

Google Buka Era Baru AI, Gemini 4 Argon Hadir dengan Klaim Performa Terdepan

Sorotan Hari Ini – Gemini 4 Argon resmi diumumkan Google pada 30 September 2026 sebagai model frontier terbaru dari keluarga Gemini. Model ini dirancang untuk menangani pekerjaan kompleks yang berlangsung dalam banyak tahap. Google menempatkan software engineering, pekerjaan profesional, serta pertahanan siber sebagai tiga area penting Argon. Menariknya, peluncurannya tidak langsung diberikan kepada semua pengguna. Google lebih dulu menyediakan model tersebut kepada kelompok pertahanan siber tepercaya melalui Fairwind Program. Strategi ini menunjukkan dua hal sekaligus. Pertama, Google percaya Argon membawa peningkatan kemampuan yang besar. Kedua, kemampuan tersebut juga membutuhkan pengamanan sebelum akses diperluas. Oleh sebab itu, Gemini 4 Argon bukan sekadar pembaruan chatbot. Google memposisikannya sebagai sistem untuk membantu menyelesaikan alur kerja profesional yang panjang dan rumit.

Baca Juga: 6 Alasan Inggris Pertimbangkan ke Uni Eropa setelah Brexit Dinilai Merugikan

Google Membidik Tugas Panjang yang Membutuhkan Penalaran Mendalam

Salah satu fokus utama Gemini 4 Argon adalah long-horizon workflows. Istilah tersebut menggambarkan pekerjaan yang tidak selesai hanya dengan satu pertanyaan dan satu jawaban. Sebaliknya, AI perlu memahami konteks, menyusun langkah, menggunakan informasi sebelumnya, lalu mempertahankan konsistensi selama proses panjang. Google mengatakan Argon dikembangkan untuk mempertahankan penalaran mendalam dalam skenario seperti ini. Kemampuan tersebut penting dalam software engineering, analisis keuangan, pekerjaan hukum, serta cybersecurity. Dengan demikian, persaingan AI mulai bergerak lebih jauh dari sekadar kemampuan menghasilkan teks. Model generasi baru semakin diarahkan untuk menyelesaikan rangkaian pekerjaan. Namun, performa di dunia nyata tetap bergantung pada kualitas data, alat yang tersedia, instruksi pengguna, serta mekanisme pengawasan manusia.

Batas Output Satu Juta Token Menjadi Peningkatan Besar

Argon membawa peningkatan mencolok pada kapasitas output. Google menyebut batas output model ini mencapai 1 juta token, naik dari 64.000 token pada model sebelumnya yang dijadikan perbandingan perusahaan. Ruang sebesar itu dirancang agar model dapat mempertahankan proses panjang dalam satu lintasan kerja. Secara praktis, kemampuan tersebut dapat membantu pekerjaan seperti analisis codebase besar, penyusunan laporan panjang, atau migrasi software. Namun, jumlah token yang besar tidak otomatis membuat setiap jawaban lebih baik. Output panjang tetap membutuhkan struktur, verifikasi, dan tujuan yang jelas. Karena itu, nilai sebenarnya terletak pada kemampuan model menggunakan kapasitas tersebut secara efektif. Bagi pengembang dan perusahaan, peningkatan ini membuka kemungkinan penggunaan AI pada proyek yang sebelumnya harus dipecah menjadi banyak sesi terpisah.

Kemampuan Coding Menjadi Salah Satu Senjata Utama Argon

Google memberikan perhatian besar pada kemampuan software engineering. Dalam DeepSWE v1.1, perusahaan melaporkan skor 77,9 persen untuk Gemini 4 Argon. Benchmark tersebut dirancang untuk menguji pekerjaan software engineering dunia nyata yang membutuhkan proses panjang. Selain itu, Google telah menggunakan Argon secara internal untuk berbagai pekerjaan coding. Salah satu proyeknya melibatkan migrasi codebase C dan C++ menuju Rust. Skala proyek tersebut beragam, bahkan mencakup lebih dari 800.000 baris kode pada kernel Zircon milik Fuchsia OS. Namun, Google juga menegaskan bahwa perubahan pada sistem penting tetap melewati audit, pengujian, dan peninjauan manusia. Fakta tersebut memberikan konteks penting. AI dapat mempercepat pekerjaan engineering, tetapi validasi tetap menjadi bagian penting ketika kode menyentuh sistem produksi.

Tidak Semua Benchmark Dimenangkan Gemini 4 Argon

Klaim performa terdepan perlu dibaca dengan konteks. Argon memang menunjukkan hasil kuat pada sejumlah evaluasi. Namun, model tersebut tidak memimpin pada setiap benchmark. Data yang merangkum tabel evaluasi Google menunjukkan Argon unggul pada sejumlah pengujian knowledge work, long context, dan coding tertentu. Sebaliknya, model lain mencatat skor lebih tinggi pada beberapa pengujian seperti FrontierSWE v2, Terminal-Bench 4.0, dan OSWorld 2.0. Bahkan pada CWE-bench v1, Argon mencatat skor 68 persen dan berbagi posisi teratas dalam pengukuran utama. Karena itu, istilah “performa terdepan” lebih tepat dipahami sebagai klaim berdasarkan area dan benchmark tertentu. Hasil benchmark juga tidak selalu menggambarkan performa setiap pengguna dalam kondisi nyata.

Google Sudah Menggunakan Argon untuk Pekerjaan Internal

Gemini 4 Argon bukan hanya dipamerkan melalui angka benchmark. Google mengatakan ribuan karyawannya telah menggunakan model tersebut dalam berbagai alur kerja internal. Contohnya mencakup coding, riset mendalam, dan penulisan. Dalam proyek quantum computing, Argon membantu peneliti mengoptimalkan kebutuhan sumber daya pada subrutin tertentu. Google mengklaim salah satu eksperimen mengalahkan baseline yang telah dipublikasikan sebesar 40 persen. Pada proyek lain, agen berbasis Argon menganalisis data profiling pusat data. Sistem kemudian menemukan optimasi memori yang, setelah diterapkan, membebaskan lebih dari 300 TiB memori. Google memperkirakan potensi penghematan total dapat mencapai 500 TiB hingga 1 PiB. Angka tersebut berasal dari laporan perusahaan, sehingga tetap perlu dibaca sebagai hasil internal Google.

Cybersecurity Menjadi Area yang Mendapat Perhatian Khusus

Kemampuan cybersecurity menjadi salah satu bagian paling menonjol dari Gemini 4 Argon. Google melatih model tersebut untuk menemukan, memvalidasi, dan membantu memperbaiki kerentanan software. Pada CWE-bench v1, Google melaporkan skor 68 persen. Selain itu, perusahaan menyatakan Argon mampu menemukan berbagai kerentanan pada codebase yang mencakup 20 bahasa pemrograman dalam benchmark internalnya. Wiz juga menggunakan Argon melalui inisiatif Scan for Good. Dalam salah satu demonstrasi awal, model tersebut dilaporkan menemukan kerentanan serius pada software kesehatan yang digunakan rumah sakit. Google mengatakan kerentanan itu tidak ditemukan oleh sejumlah model frontier sebelumnya. Kemampuan seperti ini menjelaskan mengapa akses awal Argon diberikan secara terbatas kepada pihak pertahanan siber yang dipercaya.

Akses Gemini 4 Argon Belum Dibuka Luas

Meskipun telah diumumkan, Gemini 4 Argon belum langsung tersedia secara luas untuk publik. Google memulai distribusi melalui Fairwind Program kepada kelompok trusted cyber defenders. Perusahaan juga terlibat dalam proses sukarela pemerintah Amerika Serikat untuk akses model sebelum peluncuran lebih luas. Google mengatakan masukan dari penguji awal akan digunakan untuk menyempurnakan guardrails. Setelah tahap tersebut, perusahaan berencana memperluas akses kepada pengembang, perusahaan, dan konsumen. Pendekatan bertahap ini berkaitan dengan kemampuan model yang dapat digunakan untuk pekerjaan siber tingkat lanjut. Semakin kuat kemampuan agen AI dalam berinteraksi dengan software, semakin besar pula kebutuhan untuk mencegah penyalahgunaan. Karena itu, keamanan menjadi bagian dari strategi peluncuran, bukan sekadar fitur tambahan setelah produk tersedia.

Harga Awal Argon Menargetkan Pengembang dan Perusahaan

Google juga telah mengungkap harga perkenalan Gemini 4 Argon. Model tersebut direncanakan memiliki tarif US$2 per satu juta token input dan US$10 per satu juta token output pada periode harga awal. Cached input mendapatkan diskon 95 persen dari harga input. Struktur harga ini menunjukkan bahwa Google ingin Argon digunakan untuk pekerjaan yang membutuhkan konteks besar dan proses panjang. Namun, biaya nyata sebuah proyek AI tidak hanya bergantung pada tarif token. Perusahaan juga perlu menghitung infrastruktur, integrasi, pengujian, keamanan, dan pengawasan. Oleh sebab itu, harga token merupakan satu bagian dari total biaya implementasi. Google sendiri menyebut tarif yang diumumkan sebagai harga perkenalan.

Kemampuan Multimodal Memperluas Jenis Pekerjaan yang Bisa Ditangani

Argon tidak hanya berfokus pada teks dan kode. Google juga menonjolkan kemampuan reasoning dan multimodal sebagai bagian dari model tersebut. Kombinasi ini memungkinkan AI bekerja dengan berbagai bentuk informasi dalam alur kerja kompleks. Dalam praktiknya, kemampuan multimodal berpotensi berguna ketika dokumen memuat grafik, gambar, atau informasi visual lainnya. Hal tersebut semakin relevan dalam pekerjaan profesional karena data perusahaan jarang hadir dalam satu format saja. Laporan dapat memuat tabel, presentasi dapat berisi diagram, sedangkan pekerjaan engineering bisa melibatkan kode dan dokumentasi sekaligus. Namun, kemampuan multimodal tetap perlu diuji sesuai kasus penggunaan. Performa tinggi pada satu benchmark visual belum tentu menjamin ketepatan dalam semua jenis dokumen atau lingkungan bisnis.

Performa Tinggi Tetap Membutuhkan Verifikasi Manusia

Kehadiran model yang semakin kuat tidak menghilangkan kebutuhan akan pengawasan. Google sendiri menggambarkan sejumlah pekerjaan internal Argon sebagai proses yang tetap melalui audit dan review. Hal tersebut sangat penting dalam software engineering, keamanan, hukum, dan keuangan. Kesalahan kecil dalam bidang tersebut dapat menghasilkan konsekuensi besar. Selain itu, benchmark AI mengukur kemampuan dalam kondisi tertentu. Lingkungan nyata jauh lebih beragam karena data dapat tidak lengkap, instruksi bisa ambigu, dan sistem perusahaan memiliki aturan berbeda. Karena itu, Argon lebih tepat dipandang sebagai alat untuk memperluas kemampuan manusia. Model dapat mempercepat analisis dan membantu mengerjakan tugas panjang. Namun, keputusan kritis tetap membutuhkan validasi yang sesuai dengan tingkat risikonya.

Gemini 4 Argon Menunjukkan Arah Baru Persaingan AI

Peluncuran Gemini 4 Argon memperlihatkan perubahan arah industri AI. Persaingan tidak lagi hanya berpusat pada siapa yang dapat menjawab pertanyaan dengan cepat. Model frontier kini berlomba menangani pekerjaan yang berlangsung lama, melibatkan banyak langkah, dan berinteraksi dengan sistem nyata. Google memilih coding, enterprise knowledge work, dan cybersecurity sebagai panggung utama Argon. Pada saat yang sama, perusahaan membatasi akses awal karena kemampuan tersebut juga membawa risiko baru. Data benchmark awal menunjukkan performa kuat di sejumlah kategori, tetapi Argon tidak memimpin semuanya. Oleh sebab itu, klaim performa terdepan sebaiknya dibaca berdasarkan tugas dan evaluasi tertentu. Yang jelas, Gemini 4 Argon memperlihatkan ambisi Google untuk menjadikan AI sebagai sistem kerja yang semakin mandiri, panjang, dan terintegrasi dengan aktivitas profesional.