Model kecerdasan buatan Grok-4.20 Expert Mode dan OpenAI GPT-5.4 Pro (Vision) mencatat skor IQ tertinggi sebesar 145 poin dalam pengujian yang dilakukan pada April 2026. Pencapaian ini dilaporkan oleh platform Tracking AI melalui visualisasi data dari Visual Capitalist guna membandingkan tingkat kepintaran 26 model AI yang ada saat ini.
Dominasi kedua model tersebut diikuti oleh Gemini 3.1 Pro Preview di posisi kedua dengan raihan 141 poin, sebagaimana dilansir dari Tekno. Angka-angka ini menunjukkan peningkatan signifikan dibandingkan tahun 2025, yang mana skor tertinggi pada periode tersebut hanya menyentuh angka 135 poin.
Dalam daftar sepuluh besar, model AI asal China, Qwen 3.5 buatan Alibaba, berhasil menduduki peringkat ke-10 dengan skor 130. Pengujian ini menggunakan standar tes IQ Mensa Norwegia yang terdiri dari 35 teka-teki pola visual untuk mengukur kemampuan penalaran masing-masing sistem.
Metode penilaian dibedakan menjadi dua kategori, yakni model berbasis teks (non-vision) dan multimodal (vision). Model non-vision menerima soal dalam bentuk deskripsi verbal, sedangkan model vision mengerjakan soal menggunakan gambar asli tanpa melalui modifikasi deskripsi tambahan.
| Peringkat | Model AI | Skor IQ |
|---|---|---|
| 1 | Grok-4.20 Expert Mode | 145 |
| 1 | OpenAI GPT-5.4 Pro (Vision) | 145 |
| 2 | Gemini 3.1 Pro Preview | 141 |
| 3 | OpenAI GPT-5.4 Thinking (Vision) | 139 |
| 4 | OpenAI GPT-5.3 | 136 |
| 5 | Grok-4.20 Expert Mode (Vision) | 133 |
| 5 | OpenAI GPT-5.4 Thinking | 133 |
| 5 | Meta Muse Spark | 133 |
| 6 | Gemini 3.1 Pro Preview (Vision) | 132 |
| 7 | Qwen 3.5 | 130 |
| 7 | Claude 4.6 Opus | 130 |
| 8 | Kimi K2.5 | 127 |
| 9 | Manus | 115 |
| 10 | DeepSeek R1 | 112 |
| 11 | DeepSeek V3 | 111 |
| 12 | Gemini 3.1 Flash | 110 |
| 12 | Llama 4 Maverick | 110 |
| 13 | GPT-5.3 (Vision) | 109 |
| 14 | Claude 4.6 Sonnet | 106 |
| 15 | Bing Copilot | 101 |
| 16 | Perplexity | 97 |
| 17 | Mistral Medium 3.1 | 96 |
| 18 | Claude 4.6 Sonnet (Vision) | 94 |
| 19 | Claude 4.6 Opus (Vision) | 82 |
| 20 | Llama 4 Maverick (Vision) | 79 |
| 21 | GPT-5.4 Pro (non-vision) | 73 |
Tracking AI menerapkan aturan pengulangan hingga 10 kali jika sebuah model menolak memberikan jawaban atas pertanyaan tertentu. Skor akhir diambil berdasarkan respons terakhir yang diberikan oleh sistem kecerdasan buatan tersebut sebelum batas pengulangan berakhir.
Meskipun hasil ini memberikan gambaran persaingan antar perusahaan teknologi, Tracking AI menekankan bahwa skor tersebut hanya mengukur satu aspek kecerdasan. Kemampuan penalaran pola melalui tes IQ tidak dianggap sebagai tolok ukur mutlak untuk menilai kecerdasan AI secara menyeluruh.