14 Temmuz 2026'da PrismML adlı ABD merkezli bir yapay zeka girişimi, sektörde uzun süredir "imkansız" sayılan bir şeyi başardığını duyurdu: 27 milyar parametreli bir dil modelini, tamamen cihazın kendi belleğinde çalışacak kadar küçültmek. Bonsai 27B adı verilen model, normalde 54 gigabayt yer kaplayan bir yapay zekayı 4 gigabaytın altına indiriyor ve iPhone gibi sıradan bir akıllı telefonda çalışabiliyor. Bu yazıda bu modelin ne olduğunu, nasıl bu kadar küçüldüğünü ve günlük kullanıcı için ne ifade ettiğini anlatıyoruz.
Bonsai 27B nasıl bu kadar küçüldü?
Normalde 27 milyar parametreli bir modelin her bir parametresi 16 bit (2 bayt) hassasiyetle saklanır; bu da toplamda yaklaşık 54 gigabaytlık bir dosya demektir. PrismML, bu modeli iki farklı şekilde sıkıştırdı: "ternary" (üçlü) sürümde her ağırlık yalnızca -1, 0 veya +1 değerlerinden birini alıyor ve dosya boyutu 5,9 gigabayta iniyor; "1-bit" sürümde ise ağırlıklar sadece -1 veya +1 olabiliyor ve boyut 3,9 gigabayta kadar düşüyor.
Bu, klasik "kuantizasyon" yöntemlerinden farklı bir yaklaşım. Çoğu sıkıştırma tekniği modelin yalnızca belirli katmanlarını küçültürken, PrismML modelin tamamını - gömme katmanından dikkat mekanizmasına, çıktı katmanına kadar - aynı düşük hassasiyette tutuyor. Temel model olarak Alibaba'nın açık kaynaklı Qwen3.6-27B modelini kullanıyorlar ve bu model zaten görsel girdi kabul edebilme, araç çağırma (tool calling) ve 262 bin token'lık bağlam penceresi gibi yetenekleri beraberinde getiriyor.
Ne kadar hızlı ve ne kadar isabetli?
Şirketin kendi 15 kıyaslama testine göre ternary sürüm tam hassasiyetli modelin performansının yüzde 94,6'sını, 1-bit sürüm ise yaklaşık yüzde 89,5-90'ını koruyor. Ancak bu kayıp her alanda eşit dağılmıyor: matematik ve kod üretimi görevlerinde performans nispeten iyi korunurken, komut takibi, çok adımlı araç kullanımı ve görsel anlama gibi alanlarda düşüş daha belirgin.
Hız tarafında rakamlar kaynağa göre değişiyor. PrismML, iPhone 17 Pro Max üzerinde MLX altyapısıyla saniyede yaklaşık 11 token üretildiğini, bağımsız incelemelerin ise gerçek kullanımda saniyede 5-12 token arasında bir hız gözlemlediğini aktarıyor. Bu, günlük sohbet ve kısa metin üretimi için kullanılabilir bir hız ama uzun ve karmaşık çıktılarda beklemeyi hissedeceğiniz anlamına geliyor. Mac gibi daha güçlü cihazlarda bu rakam saniyede 80 token'ın üzerine çıkabiliyor.
| Sürüm | Boyut | FP16'ya göre performans |
|---|---|---|
| Ternary (1,58-bit) | ~5,9 GB | ~%94,6 |
| 1-bit (binary) | ~3,9 GB | ~%89,5-90 |
| Orijinal (FP16) | ~54 GB | %100 (referans) |
Hangi cihazlarda çalışıyor?
1-bit Bonsai 27B, Apple'ın MLX çatısı üzerinden iPhone ve iPad'de; llama.cpp üzerinden Nvidia GPU'larda (CUDA) ve Mac'lerde (Metal) çalışabiliyor. Ayrıca WebGPU desteğiyle tarayıcı üzerinden, kurulum gerektirmeden de denenebiliyor. PrismML, modelin resmi olarak iPhone 17 Pro Max gibi 12 GB RAM'e sahip cihazlarda rahatça çalıştığını belirtiyor; bazı bağımsız incelemeler ise 8 GB RAM'li daha eski iPhone modellerinde de çalışabildiğini aktarıyor, ancak bu cihazlarda performans daha değişken olabilir. Model ağırlıkları Hugging Face üzerinde Apache 2.0 lisansıyla, yani ücretsiz ve ticari kullanıma açık şekilde paylaşılıyor.
Bu neden önemli?
Bugüne kadar 27 milyar parametre sınıfındaki modeller pratikte veri merkezi işiydi; birden fazla güçlü GPU gerektiriyorlardı. Bonsai 27B'nin önemi, bu sınıftaki bir modeli ilk kez cebe sığdırmayı başarması. Bunun kullanıcı için üç somut karşılığı var: internet bağlantısı olmadan çalışabilme, sorgularınızın cihazınızdan hiç çıkmaması sayesinde daha güçlü bir gizlilik ve bulut API maliyeti olmadan kullanım.
Ayrıca bu gelişme tek başına bir olay değil; PrismML'in "zeka yoğunluğu" yaklaşımı olarak adlandırdığı bu teknik, aynı donanımla daha fazla iş yapmayı hedefleyen daha geniş bir trendin parçası. CNBC'ye göre Apple dahil birkaç şirket, PrismML'in modellerini hız, enerji verimliliği ve cihaz üzerindeki performans açısından değerlendiriyor; ancak görüşmelerin henüz erken aşamada olduğu belirtiliyor.
Bulutta kalan bir yeteneğin cihazın içine taşınması, yapay zekada gizlilik tartışmasının yönünü değiştirebilecek türden bir adım.
Sınırlamaları neler?
- Hız, bulut tabanlı büyük modellerin gerisinde; uzun ve karmaşık görevlerde bekleme süresi hissediliyor.
- Performans kaybı görevlere göre eşit dağılmıyor; görsel anlama ve çok adımlı araç kullanımı diğer alanlara göre daha çok etkileniyor.
- iOS gibi işletim sistemleri tek bir uygulamaya fiziksel belleğin yaklaşık yarısını ayırıyor, bu da eski veya düşük RAM'li cihazlarda modelin çalışmasını zorlaştırabiliyor.
- Şu ana kadar paylaşılan performans rakamlarının büyük bölümü PrismML'in kendi testlerine dayanıyor; bağımsız, geniş çaplı testler henüz sınırlı.
Sonuç
Bonsai 27B, "büyük modeller sadece bulutta çalışır" varsayımını sarsan somut bir örnek. Elbette bulut tabanlı devasa modellerin gücüyle birebir yarışmıyor ve performans kaybı bazı görevlerde belirgin. Ama internetsiz çalışma, gizlilik ve maliyet avantajı arayan kullanıcılar ve geliştiriciler için ciddi bir alternatif sunuyor. Önümüzdeki aylarda benzer sıkıştırma tekniklerinin başka modellere de uygulanması, cihaz üzerinde yapay zekanın 2026'nın en belirgin trendlerinden biri olmaya devam edeceğine işaret ediyor.
Bu tür duyurularda şirketin kendi seçtiği kıyaslama rakamlarına temkinli yaklaşmakta fayda var; "yüzde 90 performans" ifadesi kulağa etkileyici gelse de hangi görevlerde bu oranın tutmadığını da okumak gerekiyor. Yine de mimari olarak ilginç bir adım: aynı yaklaşımın önümüzdeki dönemde başka açık modellere uygulanmasını bekliyorum.
Sık sorulan sorular
Bonsai 27B'yi kendi telefonuma nasıl kurarım?
Model, Hugging Face üzerinden Apache 2.0 lisansıyla ücretsiz olarak paylaşılıyor. iPhone ve iPad'de MLX Swift tabanlı uygulamalar üzerinden, bilgisayarda ise llama.cpp veya WebGPU destekli tarayıcı üzerinden çalıştırılabiliyor; ortalama bir kullanıcı için kurulum şu an için teknik bilgi gerektiriyor.
Bonsai 27B, ChatGPT veya Claude'un yerini tutar mı?
Hayır, en azından şimdilik. Bulut tabanlı büyük modeller hem hız hem de karmaşık görevlerde hâlâ daha güçlü. Bonsai 27B'nin asıl değeri, internetsiz ve gizliliği önceliklendiren senaryolarda makul bir alternatif sunması.
Hangi iPhone modelleri Bonsai 27B'yi çalıştırabilir?
PrismML resmi olarak iPhone 17 Pro Max gibi 12 GB RAM'e sahip cihazları referans gösteriyor. Bazı bağımsız testler 8 GB RAM'li daha eski modellerde de çalıştığını aktarsa da bu cihazlarda performans daha değişken olabilir.
Bonsai 27B ücretsiz mi?
Evet, model ağırlıkları Apache 2.0 lisansıyla ücretsiz ve ticari kullanıma açık şekilde paylaşılıyor.