- GPT-5 dan GPT-5.2 meningkatkan penalaran ilmiah dan matematika, dengan hasil terdepan dalam tolok ukur seperti GPQA Diamond dan FrontierMath.
- Model bertindak sebagai asisten peneliti: mereka membantu memecahkan masalah yang belum terselesaikan, mengoptimalkan eksperimen, dan menganalisis literatur, tetapi mereka memerlukan verifikasi manusia.
- Penerapannya meluas ke bidang kedokteran, laboratorium basah, universitas, dan bisnis, meningkatkan produktivitas tetapi menimbulkan tantangan etika, keselamatan, dan regulasi.
Kemajuan pesat yang dibawa oleh GPT-5 dan GPT-5.2 dalam penelitian ilmiah mendefinisikan ulang cara sains dilakukan : dari matematika teoretis hingga eksperimen laboratorium basah, yang mencakup biologi, fisika, kedokteran, dan ilmu material tingkat lanjut. Model-model ini tidak hanya menghasilkan laporan; model-model ini mulai digunakan sebagai asisten penelitian sejati, yang mampu menyarankan hipotesis, membantu merancang eksperimen, dan menemukan pola dalam data yang membutuhkan waktu berbulan-bulan untuk diidentifikasi oleh seseorang.
Pada saat yang sama, OpenAI dan seluruh ekosistem ilmiah sangat jelas mengenai satu poin penting : GPT-5 bukanlah "ilmuwan otonom" atau pengganti metode ilmiah manusia. Ia lebih berfungsi sebagai asisten dengan akses luas ke literatur, alat kuantitatif, dan kemampuan penalaran terstruktur, yang dapat mempercepat pekerjaan, tetapi tetap membutuhkan pengawasan ahli, verifikasi, dan banyak pertimbangan kritis dari para peneliti.
GPT-5 dan GPT-5.2: Generasi baru model untuk sains dan matematika
OpenAI telah menetapkan tanggal 11 Desember 2025 sebagai tanggal penting untuk peluncuran resmi GPT-5.2 , versi yang digambarkan sebagai model tercanggihnya hingga saat ini untuk tugas-tugas ilmiah dan matematika. Selama setahun terakhir, perusahaan telah berkolaborasi erat dengan para peneliti di berbagai bidang seperti matematika, fisika, biologi, dan ilmu komputer untuk mendapatkan pemahaman praktis tentang di mana AI memberikan nilai nyata dan di mana AI masih memiliki kekurangan.
Upaya ini telah menghasilkan studi kasus yang mencakup beragam disiplin ilmu , dari astronomi hingga ilmu material, di mana GPT-5 dan, kemudian, GPT-5.2 telah memainkan peran dalam bagian-bagian spesifik dari alur kerja penelitian: mendesain ulang bukti, mengeksplorasi metode pengujian alternatif, merevisi kode simulasi, mensintesis artikel, dan mengusulkan variasi protokol kecil. Menurut OpenAI, GPT-5.2 mulai menunjukkan tidak hanya peningkatan sesekali, tetapi juga peningkatan yang lebih stabil dan dapat direproduksi.
Dalam keluarga GPT-5.2, terdapat dua varian khusus untuk sains dan matematika: GPT-5.2 Pro dan GPT-5.2 Thinking . Keduanya dioptimalkan untuk penalaran mendalam dan tugas-tugas teknis yang menuntut, di mana kesalahan kecil dapat merusak seluruh analisis. GPT-5.2 Pro memprioritaskan akurasi dan presisi, memungkinkan waktu penalaran yang lebih lama, sementara GPT-5.2 Thinking berfokus pada pengambilan keputusan yang cerdas kapan harus "berpikir" lebih dalam dan kapan harus merespons lebih cepat.
Filosofi "penalaran berlapis" ini sudah ada dalam desain GPT-5 dengan mode GPT-5 Thinking -nya , yang bertindak sebagai router internal yang mampu mengevaluasi kompleksitas kueri, konteks yang tersedia, dan alat yang diperlukan (misalnya, akses ke Python) sebelum menghasilkan respons. Ia merespons dengan cepat untuk pertanyaan sederhana; untuk masalah yang kompleks, ia mengaktifkan rantai penalaran yang lebih panjang dan lebih eksplisit.
Dalam penggunaan sehari-hari, pengguna dapat memilih dari beberapa mode penalaran GPT-5 : “Otomatis,” yang memungkinkan model untuk menentukan berapa banyak waktu yang akan dihabiskan untuk masalah tersebut; “Instan,” yang memprioritaskan kecepatan daripada kedalaman; “Berpikir,” untuk jawaban yang lebih matang dan analitis; dan “Pro,” opsi yang paling ketat dan menuntut, dirancang untuk tugas-tugas di mana akurasi lebih diutamakan daripada kecepatan. Perlu dicatat bahwa GPT-5 adalah model berbayar, yang dapat diakses melalui langganan atau pembayaran per penggunaan, yang sangat relevan bagi lembaga yang mengelola data sensitif atau mereka yang memiliki anggaran penelitian yang terbatas.
Performa dalam benchmark: GPQA, FrontierMath, dan FrontierScience
Peningkatan GPT-5.2 dalam penelitian ilmiah tidak hanya didasarkan pada kesan subjektif, tetapi juga pada hasil dari tolok ukur khusus . Salah satu yang paling sering dikutip adalah GPQA Diamond, serangkaian pertanyaan pilihan ganda tingkat pascasarjana yang mencakup fisika, kimia, dan biologi, yang dirancang untuk mengukur penalaran tingkat lanjut dan bukan hanya hafalan.
Dalam GPQA Diamond, GPT-5.2 Pro mencapai tingkat keberhasilan 93,2% dan GPT-5.2 Thinking mencapai 92,4% , bekerja tanpa alat eksternal dan dengan upaya penalaran yang diatur maksimal. Dengan kata lain, model tersebut harus memecahkan masalah "sendiri," hanya melalui kemampuan analitis internalnya. Angka-angka ini jelas menempatkannya di atas generasi sebelumnya dan memperkuat perannya sebagai asisten dalam tugas pemecahan masalah dan pemahaman tingkat tinggi.
Tes benchmark lainnya adalah FrontierMath (Tier 1-3) , sebuah asesmen matematika tingkat lanjut yang memungkinkan penggunaan alat Python. Dalam skenario ini, GPT-5.2 Thinking menyelesaikan 40,3% masalah dengan upaya penalaran maksimal, persentase yang, meskipun mungkin tampak sederhana bagi orang awam, mewakili lompatan signifikan ke depan di bidang di mana sebagian besar model sebelumnya hampir tidak mencapai hasil yang bermanfaat.
Di luar angka-angka tersebut, OpenAI menegaskan bahwa kemajuan ini mencerminkan peningkatan kemampuan abstraksi dan penalaran secara keseluruhan , bukan sekadar keterampilan sempit yang dioptimalkan untuk satu tolok ukur tunggal. Mereka secara langsung menghubungkan kemampuan ini dengan alur kerja ilmiah sehari-hari: pemrograman simulasi, analisis data statistik, perancangan dan penyempurnaan eksperimen, serta interpretasi hasil.
Secara paralel, OpenAI telah memperkenalkan kerangka kerja yang lebih luas yang disebut FrontierScience , yang dirancang untuk mengevaluasi kinerja model seperti GPT-5 pada masalah ilmiah yang benar-benar baru yang bukan bagian dari data pelatihan. FrontierScience mencakup tantangan dalam bidang biologi, kimia, fisika, matematika, ilmu komputer, dan ilmu sosial, yang dirancang untuk menuntut tidak hanya pengetahuan teoretis tetapi juga perencanaan, pemikiran kritis, dan generalisasi.
Analisis awal menunjukkan bahwa GPT-5 berkinerja sangat baik ketika tugas dapat dipecah menjadi langkah-langkah yang jelas dan logis , sementara ia terus kesulitan ketika dituntut untuk menggunakan intuisi kreatif atau pemahaman mendalam tentang konteks eksperimental. Hal ini sejalan dengan pandangan yang semakin meluas di kalangan pakar AI: model generatif saat ini adalah alat bantu yang ampuh, tetapi tidak menggantikan kreativitas, intuisi, atau tanggung jawab ilmuwan manusia.
Sebuah kasus yang menjadi contoh: memecahkan masalah terbuka dalam matematika.
Salah satu contoh paling mencolok dari penggunaan model-model ini dalam ilmu murni adalah dalam teori pembelajaran statistik, di mana GPT-5.2 Pro membantu menyelesaikan masalah terbuka yang terkait dengan monotonisitas kurva pembelajaran untuk estimator kemungkinan maksimum. Pertanyaan mendasarnya intuitif: ketika kita menambahkan lebih banyak data ke model statistik yang telah ditentukan dengan benar, apakah kesalahan yang diharapkan selalu berkurang, atau mungkin malah memburuk, setidaknya di beberapa segmen?
Penelitian sebelumnya menunjukkan bahwa, dalam kondisi praktis tertentu, kurva pembelajaran tidak selalu monoton dan bahwa, ketika data ditambahkan, tingkat kesalahan dapat meningkat secara tidak terduga. Garis penelitian ini bermula dari masalah yang diangkat pada tahun 2019 di Konferensi Teori Pembelajaran (COLT) oleh Viering, Mey, dan Loog, yang memicu banyak artikel selanjutnya dengan contoh konkret dan strategi untuk mengembalikan monotonitas.
Terlepas dari kemajuan ini, satu kasus standar, yang dianggap hampir seperti buku teks, masih belum terpecahkan : model Gaussian dengan rata-rata yang diketahui dan deviasi standar yang tidak diketahui, di mana model statistik tersebut benar dan data mengikuti distribusi normal yang ideal. Dalam skenario klasik ini, studi baru menyimpulkan bahwa intuisi tradisional tetap berlaku dan bahwa lebih banyak data memang menyiratkan penurunan kesalahan rata-rata yang dapat diprediksi.
Perbedaan utama dalam penelitian ini, seperti yang dijelaskan OpenAI, terletak tidak hanya pada hasilnya tetapi juga pada prosesnya . Alih-alih memandu model langkah demi langkah dengan skema pembuktian yang terperinci, para penulis langsung menyajikan masalah terbuka tersebut kepada GPT-5.2 Pro dan menganalisis bukti yang dihasilkan dengan cermat. Kemudian mereka memvalidasi argumen tersebut dengan para ahli eksternal di bidangnya, meninjau setiap langkah secara menyeluruh, dan, setelah bukti tersebut dikukuhkan, menggunakannya untuk memperluas hasil tersebut ke dimensi yang lebih tinggi dan model statistik umum lainnya.
Pendekatan ini secara tepat menggambarkan jenis kolaborasi yang muncul antara manusia dan AI dalam penelitian teoretis : model tersebut menyarankan jalur pengujian potensial, manusia bertindak sebagai penengah yang ketat, mengoreksi, menyempurnakan, dan memutuskan apa yang diterima sebagai kontribusi yang valid. Tidak ada pendelegasian buta, melainkan kombinasi eksplorasi otomatis dan pengawasan ahli.
GPT-5 sebagai asisten peneliti: dari bilangan Erdős ke laboratorium basah
Selain statistik teoretis, GPT-5 telah digunakan dalam kasus-kasus penting lainnya . OpenAI, misalnya, telah menerbitkan sebuah makalah di mana modelnya membantu memecahkan masalah terbuka yang kompleks dalam teori bilangan yang terkait dengan warisan Erdős, bekerja sama dengan seorang matematikawan dari Universitas Columbia. Model tersebut membantu mengeksplorasi dugaan, memverifikasi langkah-langkah perantara, dan mengusulkan pendekatan alternatif yang terbukti bermanfaat.
Contoh lain yang telah menarik perhatian signifikan adalah identifikasi perubahan spesifik pada sel imun manusia dalam hitungan menit , sebuah tugas yang sebelumnya membutuhkan waktu berbulan-bulan bagi tim ilmuwan untuk menyelesaikannya. GPT-5 mengusulkan eksperimen spesifik untuk menguji hipotesis tentang perubahan ini; para peneliti mereplikasi eksperimen tersebut dan mengkonfirmasi bahwa usulan itu benar, sehingga secara signifikan mempersingkat siklus coba-coba yang biasa dilakukan.
Hasil ini merupakan bagian dari gerakan yang lebih luas oleh industri teknologi menuju sektor ilmiah . Anthropic , misalnya, telah mengumumkan integrasi chatbot Claude ke dalam alat yang digunakan oleh kelompok penelitian dan perusahaan ilmu hayati. Google telah meluncurkan "ilmuwan pendamping" yang dirancang untuk merumuskan hipotesis baru dan menyoroti bahwa model Gemma sumber terbukanya berkontribusi pada penemuan potensi jalan baru untuk terapi kanker.
OpenAI, di sisi lain, telah menciptakan unit ilmiah khusus dan merekrut tokoh-tokoh seperti Alex Lupsasca, yang dikenal karena karya teoretisnya tentang lubang hitam . Rencana perusahaan termasuk mengembangkan semacam "asisten penelitian AI otomatis" dalam jangka pendek dan, lebih jauh ke depan, alat penelitian yang hampir sepenuhnya otomatis dalam beberapa tahun ke depan, selalu dengan premis untuk tetap menempatkan peneliti manusia sebagai inti dari proses tersebut.
Di laboratorium basah, GPT-5 dan penerusnya telah terbukti bermanfaat sebagai alat bantu untuk mengoptimalkan protokol eksperimen . Berdasarkan literatur yang relevan dan data sebelumnya, model ini dapat menyarankan kondisi suhu, waktu inkubasi, dosis reagen, atau kombinasi kontrol dan replikasi. Dalam beberapa kasus yang dilaporkan, penyesuaian kecil yang disarankan oleh model telah meningkatkan kinerja reaksi kimia atau secara signifikan mengurangi waktu yang dibutuhkan untuk mendapatkan hasil yang bermanfaat.
Penggunaan GPT-5 dalam kedokteran dan praktik klinis
Salah satu bidang di mana GPT-5 menunjukkan dampak praktis yang sangat nyata adalah kedokteran , baik dalam praktik klinis maupun penelitian. Sebagai permulaan, model ini telah mapan sebagai alat untuk menganalisis laporan klinis yang kompleks (tes laboratorium, studi pencitraan, laporan pasca operasi, dll.), menghasilkan ringkasan singkat dengan temuan kunci yang menghemat waktu para profesional.
Prosedurnya sederhana: dokter atau peneliti mengunggah teks laporan atau gambar dokumen dan meminta ringkasan atau ekstraksi poin-poin yang paling relevan . GPT-5 mengembalikan versi ringkas yang menyoroti kemungkinan diagnosis, temuan penting, atau rekomendasi tindak lanjut. Namun, ini selalu dengan premis bahwa profesional harus meninjau dan memvalidasi informasi tersebut sebelum mengambil keputusan apa pun.
Aplikasi ampuh lainnya adalah pembuatan konten medis berkualitas tinggi , mulai dari ringkasan klinis hingga draf artikel ilmiah atau materi informasi untuk pasien. Berdasarkan beberapa perintah bahasa alami (misalnya, "tulis ringkasan tentang pasien dengan demam dan mialgia yang terus-menerus"), model ini menghasilkan teks yang koheren dan terstruktur dengan baik yang dapat diedit dan disesuaikan oleh para profesional sesuai kebutuhan mereka. Konten medis berkualitas tinggi yang dihasilkan oleh AI dapat mempercepat proses penulisan, selalu dengan tinjauan manusia.
GPT-5 juga dapat menyarankan diagnosis banding berdasarkan gejala dan riwayat yang dijelaskan oleh tenaga kesehatan . Sistem ini tidak menggantikan penilaian klinis, tetapi menawarkan daftar kemungkinan yang beralasan, tes pelengkap yang perlu dipertimbangkan, atau tanda bahaya yang harus disingkirkan. Dalam kasus seperti pasien berusia 50 tahun dengan kelelahan, batuk kering, dan sesak napas, sistem ini dapat mencantumkan kemungkinan diagnosis dan menyarankan pemeriksaan seperti rontgen dada, tes darah, tes fungsi paru-paru, atau tes virus.
Dalam hal perawatan yang dipersonalisasi, GPT-5 membantu menyesuaikan rencana perawatan dan strategi pencegahan dengan profil pasien, asalkan data dimasukkan secara anonim dan dengan kepatuhan ketat terhadap privasi. Misalnya, untuk pasien berusia 70 tahun dengan hipertensi, diabetes tipe 2, dan penyakit ginjal kronis, model ini dapat mencantumkan strategi manajemen terpadu, pengendalian faktor risiko, rekomendasi gaya hidup, dan pedoman tindak lanjut jangka panjang berdasarkan pedoman praktik klinis.
Terakhir, GPT-5 digunakan sebagai mesin pencari cerdas untuk literatur medis . Profesional mengajukan pertanyaan dalam bahasa alami (“Studi terbaru apa saja yang ada tentang telemedisin untuk penyakit kronis?”) dan model tersebut menemukan dan meringkas karya-karya yang relevan, membantu mereka tetap mendapatkan informasi terkini tanpa harus mencari secara manual melalui basis data yang tak terbatas. Mesin pencari dan alat seperti NotebookLM memfasilitasi pengorganisasian dan peringkasan literatur untuk para profesional.
Kualitas respons, halusinasi, dan keselamatan
Kritik yang berulang terhadap generasi model sebelumnya, seperti O3 dan O3-Pro, adalah kecenderungannya terhadap halusinasi : mengutip artikel nyata tetapi menarik kesimpulan yang salah atau ekstrapolasi yang tidak tepat. Para peneliti di bidang polimer untuk ilmu material atau di jalur pensinyalan biologis telah melaporkan bahwa GPT-5 jelas memperbaiki perilaku ini, dengan mengutip literatur yang lebih relevan dan menawarkan interpretasi yang lebih sesuai dengan teks aslinya.
Makalah teknis OpenAI menunjukkan bahwa GPT-5 secara signifikan mengurangi kesalahan faktual dibandingkan dengan GPT-4o dan model o3 miliknya sendiri , terutama ketika mode penalaran mendalam diaktifkan. Dalam lingkungan terkontrol, pengurangan tersebut mendekati 45% dibandingkan dengan GPT-4o dan hingga 80% dibandingkan dengan o3 dalam tugas-tugas tertentu, berkat kombinasi pelatihan yang lebih baik, teknik verifikasi internal, dan desain kebijakan keamanan yang lebih cermat.
Meskipun demikian, artikel OpenAI sendiri mengakui bahwa GPT-5 masih membuat asumsi yang salah atau memalsukan data , bahkan ketika tampak sangat andal. Oleh karena itu, mereka bersikeras, seperti halnya banyak akademisi, bahwa setiap keluaran model harus diperlakukan sebagai hipotesis yang harus diuji, bukan sebagai kebenaran mutlak. Dalam penelitian ilmiah, di mana reproduksibilitas dan verifikasi sangat penting, perbedaan ini sangat krusial.
Isu keamanan melampaui akurasi teknis dan ilmiah . Akses ke model-model canggih seperti GPT-5, tanpa kontrol yang memadai, dapat memfasilitasi penyebaran pengetahuan sensitif di bidang biokeamanan, kimia berbahaya, dan bidang sensitif lainnya. Hal ini telah memicu perdebatan internasional tentang model untuk akses terkontrol, pencatatan dan audit log, keterlacakan permintaan, dan filter keamanan multi-level. Alat-alat seperti ekstensi untuk mengidentifikasi konten AI merupakan bagian dari ekosistem mitigasi.
Organisasi yang menggunakan GPT-5 untuk penelitian harus berkoordinasi dengan tim hukum, petugas perlindungan data, dan komite etik . Posisi seperti spesialis hukum di lembaga perawatan kesehatan dan petugas perlindungan data memainkan peran sentral dalam memastikan kepatuhan terhadap peraturan, kerahasiaan data, dan pengelolaan hasil yang dibantu AI secara bertanggung jawab.
Keterampilan baru untuk peneliti, universitas, dan perusahaan.
Mengadopsi GPT-5 dalam penelitian ilmiah bukan hanya tentang memasang alat baru, tetapi juga tentang memperoleh keterampilan baru . Para peneliti harus belajar merumuskan pertanyaan yang efektif, menafsirkan respons secara kritis, mendokumentasikan peran model dalam proses tersebut, dan mengintegrasikan saran ke dalam protokol eksperimental atau teoretis tanpa kehilangan keterlacakan. Sumber daya tentang merumuskan pertanyaan yang efektif dan mempersonalisasi interaksi sangat penting.
Universitas dan lembaga penelitian mulai memperbarui program pelatihan mereka untuk memasukkan modul tentang literasi AI, etika, bias algoritmik, perlindungan data, dan kekayaan intelektual yang dihasilkan dengan dukungan model seperti GPT-5. Hal ini tidak hanya memengaruhi bidang STEM tetapi juga ilmu sosial dan humaniora, di mana AI digunakan untuk menganalisis kumpulan teks, survei, atau data historis yang besar.
Lembaga pendanaan dan yayasan yang mendukung proyek-proyek ilmiah juga harus menetapkan aturan yang jelas tentang penggunaan GPT-5 dalam proposal, artikel, dan laporan . Aturan-aturan ini mencakup pengungkapan apakah AI telah digunakan, menentukan versi model, merinci bagaimana hasil divalidasi, dan secara jelas menunjukkan bagian mana dari pekerjaan yang benar-benar dilakukan oleh manusia dan bagian mana yang dibantu oleh sistem.
Secara paralel, GPT-5 memiliki dampak langsung pada pemasaran, bisnis, dan komunikasi ilmiah . Perusahaan bioteknologi, teknologi medis, dan teknologi canggih dapat menggunakannya untuk menganalisis data pelanggan, menghasilkan konten khusus, mengotomatiskan respons yang kompleks, dan menerjemahkan temuan penelitian menjadi pesan yang mudah dipahami bagi investor, mitra, atau masyarakat umum.
Platform seperti SendApp sedang mengeksplorasi titik temu antara AI canggih dan saluran percakapan , menghubungkan GPT-5 dengan WhatsApp Business melalui API resmi. Hal ini memungkinkan, misalnya, sebuah laboratorium untuk mengkomunikasikan hasil terbarunya kepada mitra, mengelola pertanyaan teknis dari klien internasional, atau mengotomatiskan sebagian dari penyebaran ilmiahnya sambil mempertahankan nada yang konsisten dan profesional.
Bagi tim yang menangani volume interaksi yang besar, mengintegrasikan GPT-5 ke dalam sistem manajemen percakapan dapat meningkatkan efisiensi : model ini menyarankan respons, mengklasifikasikan permintaan, meringkas dokumentasi teknis, dan memberi masukan kepada chatbot cerdas yang mampu mempertahankan konteks, selalu dengan kemungkinan manusia meninjau atau mengambil kendali ketika situasi membutuhkannya.
Jika dilihat dari semua kegunaannya, GPT-5 dan GPT-5.2 muncul sebagai bagian sentral dari cara baru dalam melakukan sains , di mana model-model tersebut bertindak sebagai penghasil ide, fasilitator pencarian literatur yang komprehensif, pendukung dalam pembuktian matematis, dan asisten laboratorium virtual. Tanggung jawab utama tetap berada pada para ilmuwan, dokter, dan tim manusia, tetapi kecepatan pengujian hipotesis, eksplorasi jalur alternatif, dan menghubungkan hasil yang berbeda-beda meningkat berkali-kali lipat, mengantarkan era di mana lima tahun kerja dengan AI yang terintegrasi dengan baik dapat setara dengan kemajuan selama beberapa dekade dengan kecepatan tradisional.
