Golden Finance melaporkan bahwa OpenAI merilis penelitian terbaru, menggunakan pemantauan CoT (chain of thought), dapat mencegah perilaku jahat seperti model besar berbicara omong kosong dan menyembunyikan niat sebenarnya, dan juga merupakan salah satu alat yang efektif untuk mengawasi model super. OpenAI menggunakan model mutakhir o3-mini yang baru dirilis sebagai objek yang dipantau, dan model GPT-4o yang lebih lemah sebagai monitor. Lingkungan pengujian adalah tugas pengkodean yang mengharuskan AI untuk mengimplementasikan fungsionalitas dalam basis kode untuk lulus pengujian unit. Hasil penelitian menunjukkan bahwa monitor CoT berkinerja baik dalam mendeteksi perilaku "reward hacking" yang sistematis, dengan tingkat recall hingga 95%, jauh melebihi 60% perilaku yang hanya dipantau.
This page may contain third-party content, which is provided for information purposes only (not representations/warranties) and should not be considered as an endorsement of its views by Gate, nor as financial or professional advice. See Disclaimer for details.
OpenAI Merilis Pemantauan CoT untuk Menghentikan Perilaku Berbahaya Model Besar
Golden Finance melaporkan bahwa OpenAI merilis penelitian terbaru, menggunakan pemantauan CoT (chain of thought), dapat mencegah perilaku jahat seperti model besar berbicara omong kosong dan menyembunyikan niat sebenarnya, dan juga merupakan salah satu alat yang efektif untuk mengawasi model super. OpenAI menggunakan model mutakhir o3-mini yang baru dirilis sebagai objek yang dipantau, dan model GPT-4o yang lebih lemah sebagai monitor. Lingkungan pengujian adalah tugas pengkodean yang mengharuskan AI untuk mengimplementasikan fungsionalitas dalam basis kode untuk lulus pengujian unit. Hasil penelitian menunjukkan bahwa monitor CoT berkinerja baik dalam mendeteksi perilaku "reward hacking" yang sistematis, dengan tingkat recall hingga 95%, jauh melebihi 60% perilaku yang hanya dipantau.