Why can a neighbor on my inference cluster reconstruct what I just asked the model?
Peluang
Modern LLM serving frameworks like vLLM share KV-cache blocks across requests with matching prefixes to reduce compute cost. When multiple tenants share the same inference server, an adversary tenant can probe cache-hit and cache-miss latencies to reconstruct another tenant's private prompt. Three independent attacks published in 2025 and 2026, PROMPTPEEK, EarlyBird, and InputSnatch, demonstrate up to 100% prompt reconstruction accuracy against production-grade serving stacks. Providers can defeat this by running fully isolated instances per tenant, but that eliminates all the memory and compute savings that make shared inference economically viable. The KVGov governance paper from August 2026 proposes per-principal cryptographic cache salts as a fix, but no commercial inference provider has deployed it.
Mengapa ini penting
Shared inference is the cost model that makes AI accessible at scale, but right now it cannot safely carry any sensitive workload without full tenant isolation.
Cara saya menilai peluang
Skor Peluang adalah penilaian pribadi saya, bukan pengukuran: seberapa besar dampaknya, seberapa sering terasa, dan seberapa sedikit solusi yang ada saat ini. Semakin tinggi skornya, semakin layak menurut saya untuk dibangun.
Seberapa besar masalah yang ditimbulkannya saat muncul.
Seberapa sering orang benar-benar menghadapinya.
Betapa sedikitnya alat yang baik tersedia untuknya saat ini.
Lebih banyak masalah yang layak diselesaikan
Mengapa setiap aplikasi AI melupakan saya begitu saya menutup tab?
AIMengapa mempelajari bidang baru masih terganjal oleh ketidaktahuan tentang apa yang harus ditanyakan?
AIMengapa orang awam tidak bisa memverifikasi apa yang baru saja dikatakan AI kepada mereka?
AIMengapa kita menguji model pada tolok ukur tetapi meluncurkannya berdasarkan intuisi semata?
AIMengapa agen AI tidak punya ingatan atas kesalahan mereka sendiri?
AIMengapa saya tidak bisa mengaudit apa yang sebenarnya digunakan untuk melatih sebuah model?