- TypeSafe AI, startup yang didirikan oleh Diogo Almeida — salah satu penemu RLHF dan InstructGPT (teknologi di balik ChatGPT) — meluncurkan model pertamanya bernama Jev pada 15 September 2026
- Jev bukan LLM biasa — model ini sama sekali tidak menghasilkan teks, melainkan mengembalikan keputusan terstruktur dalam format yang sudah ditentukan
- TypeSafe mengklaim Jev 20-200x lebih cepat (70-500ms vs 3-329 detik) dan 40-400x lebih murah dari LLM pada tugas keputusan terstruktur
- Jev menggunakan metode pelatihan baru bernama RLCD (Reinforcement Learning for Calibrated Decisions) — berbeda dari RLHF dan RLVR
- Karena output-nya terbatas pada pilihan yang sudah ditentukan, TypeSafe mengklaim Jev secara matematis tidak bisa hallucinate
industry.co.id — Setiap rilis LLM selama tiga tahun terakhir selalu menjanjikan reasoning yang lebih baik, context window yang lebih panjang, atau kode yang lebih akurat. Namun pada 15 September 2026, seorang peneliti yang pernah membentuk wajah AI modern mengambil arah yang sama sekali berbeda. Diogo Almeida — salah satu penemu di balik RLHF dan InstructGPT, teknologi yang akhirnya melahirkan ChatGPT — meluncurkan model AI pertama dari perusahaan barunya, TypeSafe AI, yang disebut Jev.
Jev bukan chatbot. Jev bukan code assistant. Jev bahkan tidak bisa menulis satu kalimat pun. Sebaliknya, ia mengambil input — berupa teks atau data terstruktur — dan mengembalikan keputusan yang sudah diketikkan: pilihan dari daftar opsi, skor pada skala tertentu, atau probabilitas ya/tidak. Semua dalam satu forward pass paralel, bukan satu per satu seperti LLM biasa.
Apa Itu TypeSafe AI?
TypeSafe AI adalah lab AI yang beroperasi dalam mode stealth selama dua tahun sebelum keluar ke publik bersamaan dengan peluncuran Jev. Perusahaan ini didirikan oleh Diogo Almeida, yang sebelumnya bekerja di Google Brain dan OpenAI. Di OpenAI, Almeida adalah salah satu peneliti utama di balik RLHF (Reinforcement Learning from Human Feedback) — metode pelatihan yang mengubah GPT-3 menjadi InstructGPT, yang kemudian menjadi fondasi ChatGPT.
Setelah membantu menciptakan era chatbot AI, Almeida menghabiskan dua tahun berikutnya bertanya pada pertanyaan berbeda: mengapa otomatisasi yang dijanjikan AI belum juga datang? Jawabannya, menurut Almeida, adalah bahwa chat model adalah cara yang paling lambat dan paling mahal untuk membuat keputusan kecil yang berulang di dalam sistem produksi.
TypeSafe membangun teknologi yang berlawanan dengan arus utama AI. Sementara perusahaan lain berlomba memperbesar model dan memperpanjang reasoning chain, TypeSafe membuat model yang lebih kecil, lebih cepat, dan hanya bisa melakukan satu hal: membuat keputusan terstruktur.
Apa Itu Jev?
Jev adalah model pertama dari TypeSafe AI dan yang pertama di kategori yang mereka sebut "System One Model". Nama ini terinspirasi dari buku Thinking, Fast and Slow karya Daniel Kahneman — System 1 adalah penilaian cepat dan intuitif yang dilakukan otak tanpa berpikir sadar, sementara System 2 adalah analisis lambat dan mendalam.
Jev dirancang untuk menjadi sangat baik dan sangat murah dalam tugas System 1: pengenalan instan, klasifikasi cepat, dan pengambilan keputusan berulang. Ia tidak bisa melakukan System 2 — tidak bisa menulis kode, tidak bisa mengobrol, tidak bisa menghasilkan paragraf.
Cara Kerja Jev
Input ke Jev terdiri dari:
- Konteks — teks tidak terstruktur atau data JSON dari state program
- Pertanyaan — diformulasikan sebagai salah satu dari tiga primitif
Tiga tipe output Jev:
| Tipe Output | Fungsi | Contoh Penggunaan |
|---|---|---|
| Choice | Pilih 1 dari maksimal 255 opsi yang sudah ditentukan, beserta distribusi probabilitas | Routing: "Email ini masuk kategori: spam / promosi / penting / personal" |
| Score | Kembalikan nilai pada skala kontinu | "Seberapa besar kemungkinan pelanggan ini churn? (0-1)" |
| Noul | Probabilitas ya/tidak yang sudah dikalibrasi (portmanteau dari "boolean") | "Apakah konten ini melanggar kebijakan? Ya/Tidak" |
Setiap output disertai dengan confidence score — tingkat kepercayaan model terhadap jawabannya. Yang menarik, skor ini dikalibrasi: jika Jev mengatakan "70% yakin," maka secara statistik ia benar sekitar 70% dari waktu.
Mengapa Output-nya Gratis?
Karena output space Jev sudah ditentukan sebelumnya dan terbatas (maksimal 255 opsi), TypeSafe bisa menghitung probabilitas setiap jawaban yang mungkin dalam satu forward pass paralel. Tidak ada loop decoding autoregresif seperti LLM biasa yang menghasilkan satu token pada satu waktu. Tanpa decoding loop, tidak ada yang perlu dihitung — dan karenanya, output tokens dihargai gratis.
Perbandingan Jev vs LLM Tradisional
| Dimensi | LLM Tradisional | Jev / System One |
|---|---|---|
| Training Objective | RLHF (preferensi manusia) atau RLVR (rewards yang bisa diverifikasi) | RLCD (keputusan yang dikalibrasi) |
| Output | Teks bebas — teks, kode, penolakan, atau nilai terstruktur setelah parsing | Nilai bertipe dari himpunan tetap: Choice, Score, Noul |
| Sampling | Sequential, satu token bergantung pada token sebelumnya | Paralel — semua primitif dihitung dalam satu pass |
| Biaya Input | US$ 0,20 - US$ 10 per juta token | US$ 0,042 per juta token (Rp 700) |
| Biaya Output | Sering ~5x harga input | Gratis (tanpa decode loop) |
| Latensi | 3 - 329 detik untuk model frontier | 70ms - 500ms |
| Confidence | Tidak konsisten kecuali diminta secara eksplisit | Probabilitas yang dikalibrasi melekat pada setiap jawaban |
| Context Window | Ratusan ribu token | 32K token |
| Multimodal | Teks, gambar, kadang audio/video | Teks dan JSON terstruktur saja, belum ada gambar |
RLCD: Metode Pelatihan Baru di Balik Jev
Jev dilatih dengan metode yang disebut RLCD — Reinforcement Learning for Calibrated Decisions. Ini berbeda dari dua metode pelatihan utama yang dominan saat ini:
- RLHF (Reinforcement Learning from Human Feedback) — mengoptimalkan output yang disukai manusia. Digunakan untuk ChatGPT, Claude, dan sebagian besar LLM chat.
- RLVR (Reinforcement Learning with Verifiable Rewards) — mengoptimalkan output yang secara verifikasi benar, seperti kode yang lulus test case. Digunakan untuk model reasoning.
- RLCD (Reinforcement Learning for Calibrated Decisions) — mengoptimalkan kalibrasi: model yang mengatakan "70% yakin" harus benar sekitar 70% dari waktu secara konsisten.
Perbedaan ini penting. RLHF menghasilkan model yang terdengar meyakinkan tapi bisa salah dengan percaya diri. RLVR menghasilkan model yang benar pada tugas yang bisa diverifikasi. RLCD menghasilkan model yang kalibrasi — kepercayaan dirinya selaras dengan akurasi aktualnya.
Klaim "Tidak Bisa Hallucinate": Apa Artinya Sebenarnya?
TypeSafe memasarkan Jev dengan klaim bahwa model ini "secara matematis tidak bisa hallucinate." Grafik 0% hallucination dipajang di halaman peluncuran mereka. Tapi apa artinya sebenarnya?
Klaim ini valid secara teknis tapi terbatas: karena output space Jev sudah ditentukan dan dikelompokkan sebelumnya (maksimal 255 opsi), Jev secara harfiah tidak bisa mengembalikan nilai yang tidak valid — seperti halnya classifier tidak bisa menghasilkan label yang tidak ada di daftar kelasnya.
Namun, jawaban yang valid bisa tetap salah dengan percaya diri. Analogi sederhananya: classifier spam yang mengatakan "ini bukan spam" dengan confidence 99% mungkin salah — jawabannya valid (ada di daftar opsi), tapi keputusannya keliru. TypeSafe sendiri mengakui hal ini. Di diskusi Hacker News yang menarik 256 komentar, CEO TypeSafe langsung setuju: "dimungkinkan untuk salah dengan percaya diri (dan semua model di masa depan akan lebih pintar tapi tetap memiliki kemungkinan itu)."
Demo Doom yang Viral
Salah satu demo yang paling banyak dibicarakan dari peluncuran Jev adalah kemampuannya bermain game Doom secara real-time. Namun ada nuansa penting yang perlu dipahami:
- Jev tidak "melihat" game seperti manusia — ia menerima deskripsi teks dari state game dalam format JSON (posisi musuh, jarak, sudut tembak)
- Ini berarti Jev memiliki informasi yang tidak dimiliki pemain manusia — bisa "melihat menembus tembok" dan tahu koordinat pasti
- Demo ini adalah demonstrasi yang sah dari pengambilan keputusan latensi rendah, tapi bukan bukti kecerdasan game-playing umum
- TypeSafe sendiri tidak mengklaim sebaliknya setelah ditanya
Kasus Penggunaan Jev
Karena Jev bukan LLM umum, penggunaannya spesifik untuk tugas-tugas keputusan berulang yang membutuhkan kecepatan dan efisiensi biaya:
1. Routing dan Klasifikasi
Menentukan ke mana sebuah request harus diarahkan. Misalnya: email masuk diklasifikasikan sebagai spam, promosi, atau penting — atau ticket support diarahkan ke departemen yang tepat.
2. Safety dan Guardrails
Memeriksa apakah output dari LLM lain aman untuk ditampilkan kepada pengguna. Jev bisa bertindak sebagai lapisan keamanan yang sangat cepat di depan model generatif yang lebih lambat.
3. Scoring dan Risk Assessment
Memberikan skor pada kontinu — misalnya risiko churn pelanggan, skor kualitas lead, atau tingkat urgensi ticket.
4. AI Agent Decision Layer
Dalam pipeline agen AI, Jev bisa menjadi lapisan pengambilan keputusan cepat — misalnya memutuskan tool mana yang harus dipanggil berdasarkan intent pengguna, tanpa perlu LLM berpikir lambat.
5. Reranking dan Filtering
Memfilter dan mengurutkan hasil dari sistem retrieval atau search engine berdasarkan relevansi, tanpa overhead LLM penuh.
6. Real-time Game Agents
Seperti demo Doom, Jev bisa digunakan untuk mengambil keputusan dalam game atau simulasi yang membutuhkan respons di bawah 100ms.
Kritik dan Batasan
Peluncuran Jev langsung mendapat diskusi panas di Hacker News dengan 256 komentar. Sebagian besar kritik bukan tentang teknologi yang palsu, tapi tentang framing yang berlebihan:
1. "Frontier Model" Terlalu Klaim
Jev tidak bisa menulis kode, mengobrol, atau menghasilkan kalimat. Menyebutnya "frontier model" dalam kalimat yang sama dengan GPT atau Claude, menurut banyak komentator, meminjam kredibilitas yang belum diuji secara independen. Usulan yang lebih jujur: "advanced the speed/cost frontier for structured decisions."
2. Benchmark Tidak Independen
TypeSafe membangun "workflow evals" internal sendiri dan membandingkan Jev dengan rata-rata prediksi GPT-6 Astra dan Fable 5.1 — bukan dengan ground truth. Beberapa komentator mempertanyakan mengapa TypeSafe sengaja melewatkan benchmark publik dan hanya akan menerbitkan eval one-off.
3. Perbandingan Kecepatan Mungkin Tidak Apple-to-Apple
Angka 70ms Jev dibandingkan dengan LLM yang melakukan full autoregressive generation — bukan dengan LLM yang dikonstrain untuk menghasilkan keputusan pendek yang setara. Metodologi ini belum sepenuhnya diselesaikan.
4. Masih dalam Early Access
Jev belum tersedia untuk publik — baru bisa diakses melalui waitlist. Tidak ada halaman pricing publik atau listing OpenRouter resmi. Akses bisa didapat melalui OpenRouter, Vercel AI Gateway, Netlify AI Gateway, dan AIMLAPI.
Mengapa Ini Penting untuk Masa Depan AI?
Terlepas dari kritik terhadap framing-nya, ide di balik Jev dianggap bagus oleh banyak engineer — bahkan oleh mereka yang mengkritik TypeSafe. Beberapa alasan mengapa System One Models layak diperhatikan:
- Sebagian besar keputusan AI dalam produksi sederhana — routing, klasifikasi, filter, scoring. LLM penuh adalah overkill untuk tugas-tugas ini.
- Biaya LLM untuk keputusan berulang sangat tinggi — perusahaan besar menjalankan jutaan klasifikasi per hari. Mengurangi biaya 100x berarti penghematan signifikan.
- Latensi penting dalam banyak aplikasi — real-time systems, game, trading, dan agen AI yang harus merespons dalam milidetik, bukan detik.
- Kalibrasi adalah fitur yang langka — LLM sering kali sangat yakin saat salah. Model yang kalibrasi memungkinkan sistem membuat keputusan yang lebih baik tentang kapan harus meminta campur tangan manusia.
TypeSafe mungkin bukan yang terakhir di kategori ini. Jev adalah "preview dari kategori yang akan segera ramai," tulis salah satu analis. Tapi sebagai yang pertama, Jev menetapkan baseline yang menarik untuk model keputusan terstruktur.
Informasi Perusahaan
| Nama Perusahaan | TypeSafe AI |
| Founder & CEO | Diogo Almeida (mantan Google Brain & OpenAI) |
| Model Pertama | Jev — "System One Model" |
| Tanggal Peluncuran | 15 September 2026 |
| Metode Pelatihan | RLCD (Reinforcement Learning for Calibrated Decisions) |
| Biaya | US$ 0,042 / juta input token, output gratis |
| Latensi | 70ms - 500ms |
| Context Window | 32K token |
| Status | Early access (waitlist) |
| Akses via | OpenRouter, Vercel AI Gateway, Netlify AI Gateway, AIMLAPI |
Kesimpulan
Jev dari TypeSafe AI bukan pengganti ChatGPT atau Claude. Model ini tidak bisa mengobrol, menulis kode, atau menghasilkan teks. Tapi ia melakukan sesuatu yang tidak bisa dilakukan LLM dengan efisien: membuat keputusan terstruktur yang cepat, murah, dan terkalibrasi dalam satu forward pass.
Dengan biaya US$ 0,042 per juta token input dan latensi 70-500ms, Jev menawarkan alternatif yang menarik untuk jutaan klasifikasi dan routing yang saat ini dilakukan oleh LLM berbiaya tinggi. Klaim "tidak bisa hallucinate" mungkin terlalu dipasarkan, tapi konsep di baliknya — model yang output-nya terbatas dan terkalibrasi — adalah arah yang masuk akal untuk automasi AI yang sesungguhnya.
Bagi developer yang membangun pipeline AI, agen, atau sistem keputusan otomatis, System One Models seperti Jev layak dipantau — bukan sebagai pengganti LLM, tapi sebagai pelengkap yang mengisi celah kecepatan dan biaya yang selama ini diabaikan.
Disclaimer: Artikel ini bersifat informatif dan bukan endorsement produk. Klaim performa berdasarkan data dari TypeSafe AI dan sumber jurnalistik independen. Selalu lakukan evaluasi mandiri sebelum mengadopsi teknologi baru.
Sumber: TypeSafe AI (typesafe.ai), explainx.ai, DataCamp, LangChain, Hacker News | Penulis: Slamet Heru Susanto