System One Modelleri: Jev, Clef ve Laya — Ne İşe Yarar, Nerede Kullanılır?
Metin üretmeden, tek geçişte kalibre olasılıklarla karar veren yeni model sınıfı: nasıl çalışır, Jev, Clef/Clef-flash ve Laya arasındaki farklar, kullanım senaryoları, LLM ile birlikte kullanım, yerelde çalıştırma ve tuzaklar.
Kısa özet
Eylül–Ekim 2026'da yeni bir model sınıfı ortaya çıktı: System One modelleri. Bunlar metin üretmez. Onlara bir state (metin, JSON, ticket, e-posta; bazılarında görsel) ve tipli sorular verirsin; model izin verilen her cevabın olasılığını tek bir forward pass'te döndürür. Kodun bu sayılara bakıp dallanır.
Bu rehberde üç önemli örneği inceliyoruz: TypeSafe AI'ın kategoriyi başlatan Jev'i, Cloudflare'in açık ağırlıklı Clef ve Clef-flash'ı ve Convai Innovations'ın küçük, yerelde çalışan Laya'sı. Sonda bir karşılaştırma tablosu, senaryo kataloğu, LLM ile birlikte kullanım örneği ve bir kontrol listesi var.
Not: Bilgiler 5 Ekim 2026 itibarıyla üreticilerin kendi blog yazıları, dokümantasyonu, Hugging Face model kartları ve GitHub README'lerinden kontrol edildi. Hız, maliyet ve doğruluk rakamlarının neredeyse tamamı üreticilerin kendi ölçümleri; metinde kime ait olduğunu belirttik. Kategori birkaç haftalık; ayrıntılar hızla değişiyor.
Hangi sorunu çözüyorlar?
Yazılımın içinde sürekli küçük kararlar veririz: bu destek talebi hangi ekibe gider, bu mesaj acil mi, bu araç çağrısı güvenli mi, bu yorum moderasyona takılmalı mı? Bugün bunun için genellikle bir LLM'e "şu JSON formatında cevap ver" deriz. Bu yaklaşımın üç sorunu var:
- Yavaş ve pahalı: LLM cevabı token token üretir. Kısa bir JSON bile birkaç düzine sıralı adım demektir; reasoning açıksa üstüne görünmez düşünme token'ları eklenir.
- Kırılgan: Çıktı metindir. Ayrıştırırsın, doğrularsın, bazen yeniden denersin. Şemaya uymayan, var olmayan bir seçenek uyduran cevaplar mümkündür.
- Belirsizliği söylemez: LLM'e "ne kadar eminsin?" diye sorabilirsin ama TypeSafe'in tanıtım yazısında belirttiği gibi modeller bu konuda genellikle aşırı özgüvenli ve tutarsız. Bir görevi %95 doğru yapan ama hangi %5'te yanıldığını söylemeyen bir model o görevi otomatikleştiremez.
System One modelleri bu üç noktayı hedefliyor: cevap kümesini önceden sen tanımlarsın, model her seçeneği tek geçişte olasılıkla puanlar, sen de olasılığa göre "otomatik uygula", "insana sor" ya da "büyük modele devret" diye dallanırsın.
Nasıl çalışırlar?
Tipli sorular
Üç model de aynı üç soru tipini kullanıyor (TypeSafe dokümantasyonu, Cloudflare Workers AI şeması ve Laya README'si aynı tanımları veriyor):
| Tip | Ne sorar | Ne döner |
|---|---|---|
choice |
Tanımladığın seçeneklerden hangisi? | choice (en olası seçenek), seçenek başına probabilities, confidence |
score |
Sıralı bir rubrikte hangi seviyede? | score (olasılık ağırlıklı seviye, iki seviye arasında çıkabilir), seviye başına probabilities, confidence, legend |
noul |
Evet/hayır sorusu doğru mu? | noul: "evet" olasılığı (0–1) |
Bir istekte birden çok soru gönderilir ve hepsi aynı state'e karşı değerlendirilir. İstek gövdesi üç modelde de aynı iskelete sahip:
{
"model": "jev-latest",
"state": "Hi, I've been trying to connect my Stripe account for 3 days and the integration keeps failing. I'm losing sales. Please help ASAP.",
"questions": {
"department": {
"type": "choice",
"instructions": "Which team should handle this",
"criteria": {
"billing": "Payment or subscription issues",
"technical": "Bugs or integration problems",
"sales": "Pricing or account questions"
}
},
"frustration": {
"type": "score",
"instructions": "How frustrated the customer appears",
"criteria": ["Calm, just stating facts", "Frustrated but civil", "Very angry, strong language"]
},
"is_urgent": { "type": "noul", "instructions": "The message conveys urgency or time-sensitivity" }
}
}TypeSafe'in hızlı başlangıç sayfasındaki örnek yanıtta department için "choice": "technical", "probabilities": {"technical": 0.85, "billing": 0.15, "sales": 0.0} ve "confidence": 0.78 dönüyor. Soru anahtarlarını (department, is_urgent) sen seçersin; cevaplar aynı anahtarlarla gelir.
Tek geçiş
LLM'de her yeni token bir önceki token'a bağlı olarak sırayla üretilir. System One modelinde ise tüm soruların tüm seçenekleri bir kerede puanlanır. Mimari üreticiye göre değişiyor:
- Clef, Qwen tabanlı bir omurganın üstüne küçük bir "joint schema head" ekliyor; bu kafa omurganın son gizli durumlarını okuyup her sorunun her seçeneği için bir logit üretiyor, soru başına softmax ile olasılığa çevriliyor (Hugging Face model kartı).
- Laya, ModernBERT/mmBERT gibi bir encoder ve üstünde bir karar kafası kullanıyor (receptron/laya README'si).
- Jev'in mimarisi yayımlanmadı; TypeSafe yalnızca "yeni bir model mimarisi ve paralel örnekleyici" kullandığını söylüyor.
TypeSafe dokümantasyonuna göre soru eklemek yanıt süresini neredeyse değiştirmiyor ve her soru bağımsız değerlendirildiği için soru sayısı arttıkça "context rot" oluşmuyor.
Kalibrasyon
Kalibre bir model için "0.8 olasılık" dediği vakaların yaklaşık %80'inde haklı çıkması gerekir. TypeSafe bunun için RLCD (Reinforcement Learning for Calibrated Decisions) adını verdiği bir eğitim yöntemi kullandığını söylüyor. Laya da RLCD adını kullanıyor ve "strictly proper scoring rule"lara karşı pekiştirmeli öğrenmeyle eğitildiğini belirtiyor. Cloudflare ise Clef'i etiket yumuşatmalı cross-entropy ve kalibrasyon için Brier loss ile eğittiğini yazıyor.
Bunlar üreticilerin iddiası. Kalibrasyon dağılıma bağlıdır: senin verinde, senin soru ifadenle ve senin dilinde ölçmeden güvenme. Bunun nasıl yapılacağı aşağıdaki kontrol listesinde.
Güven (confidence) her modelde aynı şey değil
API sözleşmesi aynı olsa da confidence alanının formülü farklı. Jev (ve TypeSafe dokümantasyonu) choice için (n·p_max − 1)/(n − 1) kullanıyor. Laya'nın README'si kendi confidence değerinin "1 − normalize entropi" olduğunu ve Jev'den taşınan eşiklerin geçerli olmadığını açıkça yazıyor. Model değiştirirken eşikleri yeniden ölç.
Jev (TypeSafe AI)
TypeSafe AI, Jev'i 15 Eylül 2026'da kurucu Diogo Almeida'nın tanıtım yazısıyla erken erişimde duyurdu. Model kapalı ağırlıklı ve yalnızca TypeSafe'in API'si üzerinden kullanılıyor.
- Uç nokta:
POST https://api.typesafe.ai/v1/systemone,Authorization: Bearer <API_KEY>. Model adı olarakjev-latestalias'ı kullanılıyor; 5 Ekim itibarıyla bujev-1.13.0'a işaret ediyor. - Fiyat: Milyon input token başına 0,042 $; output token'lar ücretsiz (Models sayfası).
- Sınırlar: İstek başına 64k token; state ile en uzun soru toplamda 32k. Yalnızca metin girdisi (string, JSON nesnesi ya da metin dizisi); görsel, ses ya da video yok.
choicebaşına en fazla 255 seçenek. Oran limitleri dokümantasyonda 100K token/sn ve 80 istek/sn olarak verilmiş, ama TypeSafe bu limitlerin talebe göre haber vermeden değişebileceğini yazıyor. - Dil: Birincil eğitim dili İngilizce; diğer diller "işleniyor ama aynı kalitede değil". TypeSafe, İngilizce dışı işlerde önce kendi içeriğinle test etmeni öneriyor.
- Özelleştirme: Jev müşteri verisiyle fine-tune edilmiyor; herkes aynı ağırlıkları kullanıyor. Alana uyarlamayı state,
instructionsvecriteriaüzerinden yapıyorsun. - SDK: Python (
pip install typesafe-sdk) ve JavaScript (@typesafe-ai/sdk) istemcileri var.
TypeSafe'in iddiaları: Tanıtım yazısına göre Jev, System One görevlerinde mevcut LLM'lerle benzer zekâ seviyesinde ama "iki büyüklük mertebesi" daha hızlı ve verimli; uçtan uca yanıt süresi 70–500 ms. Ana sayfadaki "193,6 kat daha hızlı, 444,6 kat daha ucuz" rakamlarının kendi workflow değerlendirmelerinden geldiğini ve bunların "gerçek dünya kazançlarının üst ucunda" olduğunu yazının kendisi belirtiyor. TypeSafe, referans cevap olarak başka şirketlerin büyük modellerinin ortalamasını kullandığını ve değerlendirmeleri kendi ekibinin hazırladığını da not ediyor.
Bilinen zayıflıklar: TypeSafe'in "Jev 1.13 jaggedness" sayfası dürüst bir liste veriyor: talimatları harfiyen okuma, sayma ve aritmetik, tarih karşılaştırması, çok katmanlı dolaylı sorular, alakasız ayrıntıyla dolu büyük state'ler, çelişen talimat/kriterler, choice seçeneklerinin sırasına duyarlılık ve tabii ki metin üretimi. Önerisi net: matematiği ve tarih hesabını kodda yap, modele yalnızca yargı gerektiren kısmı sor.
Clef ve Clef-flash (Cloudflare)
Cloudflare 1 Ekim 2026'da Workers AI ekibinin eğittiği ilk modelleri duyurdu: @cf/cloudflare/clef ve @cf/cloudflare/clef-flash. İkisi de Jev ile aynı model ailesinde ve Jev API'si ile uyumlu; Cloudflare mevcut bir Jev entegrasyonunu uç noktayı ve model adını değiştirerek taşıyabileceğini söylüyor.
- Boyut ve temel model: Clef 27B parametreli, Qwen3.8-27B'den; Clef-flash 9B, Qwen3.5-9B'den post-train edilmiş. Blog yazısına göre omurga dondurulmuş, rank-256 LoRA adaptörleri ve karar kafası birlikte eğitilmiş.
- Lisans: Ağırlıklar Hugging Face'te Apache 2.0 ile açık (
Cloudflare/clef,Cloudflare/clef-flash). - Girdi: Metin, JSON, görsel ve video (model kartı). Workers AI'da görseller
imagesalanıyla gömülü olarak gönderiliyor (en fazla 4; uzak URL kabul edilmiyor). - Sınırlar (Workers AI şeması): İstek başına 1–64 soru;
choiceiçin 2–255 seçenek;scoreiçin 2–10 seviye; bağlam penceresi 65.536 token. - Fiyat (Workers AI): Clef milyon input token başına 0,24 $, Clef-flash 0,09 $.
- Fine-tuning: Cloudflare aynı gün bir RL fine-tuning hizmeti duyurdu; şimdilik "design partner" olarak, kendi mühendis ekibiyle birlikte yürütülüyor.
Cloudflare'in iddiaları: 43 benchmark koşusunda medyan gecikme Clef için 209,3 ms, Clef-flash için 38,8 ms, Jev için 524,1 ms (p95: 238,6 / 122,4 / 536,0 ms). Cloudflare'e göre 10 karar benchmark'ının 7'sinde en yüksek skoru bir Clef modeli alıyor; TypeSafe'in kendi workflow değerlendirmelerinde de Clef dört alanın üçünde Jev'i geçiyor. Model kartındaki geniş tablo daha karışık bir resim çiziyor: GPQA Diamond, MMLU-Pro ve BBH gibi akıl yürütme ağırlıklı testlerde Jev belirgin biçimde önde. Yani "Clef her şeyde daha iyi" değil; görev tipine göre değişiyor.
Laya (Convai Innovations)
Laya, Convai Innovations'ın açık ağırlıklı, Apache 2.0 lisanslı System One modeli. Hugging Face deposu ve PyPI'daki ilk laya sürümü 18 Eylül 2026 tarihli. Diğer ikisinden farkı boyut: milyarlarca değil, yüz milyonlarca parametre.
| Checkpoint | Encoder | Parametre | Bağlam | Ne için |
|---|---|---|---|---|
laya |
ModernBERT-large | 421M | 512 | İngilizce |
laya-multilingual |
mmBERT-base | 322M | 1.024 (8.192'ye kadar) | 100+ dil |
laya-typed-decisions |
ModernBERT-large | 421M | 1.024 | Tipli karar workflow'ları (fine-tune edilmiş) |
- Router:
layapaketindekiRouter, metnin alfabesini ve dilini tespit edip isteği İngilizce ya da çok dilli checkpoint'e yolluyor. - Jev uyumlu sunucu:
laya-serve, Jev ile aynıPOST /v1/systemonesözleşmesini sunuyor; README'ye göre mevcut bir Jev istemcisinin yalnızcabaseUrl'ini değiştirmek yetiyor. - Node/TypeScript:
@receptron/layapaketi modeli ONNX Runtime ile çalıştırıyor; çalışma anında Python ya da PyTorch gerekmiyor. - Fine-tuning: Kaggle'ın ücretsiz 2×T4 GPU'larında çalışan bir fine-tuning notebook'u var. Model kartına göre fine-tune edilmiş
laya-typed-decisions, aynı 2.000 kararda temel İngilizce checkpoint'in 0,362'lik doğruluğunu 0,766'ya çıkarıyor.
Convai'nin iddiaları: Tek soru için yaklaşık 33 ms, toplu çalıştırmada soru başına 7,2 ms (T4 GPU üzerinde ölçülmüş). receptron README'sine göre Node paketiyle üç soruluk bir çağrı, model ısındıktan sonra Apple Silicon CPU'da yaklaşık 140 ms sürüyor.
Dürüst sınırlar (README'nin kendisinden): Seçenekler sabit bir token bütçesini paylaşıyor (İngilizce checkpoint'te 192, diğerlerinde 256 token), bu yüzden yaklaşık 20 seçeneğin üstünde doğruluk belirgin düşüyor; Banking77'de (72–77 etiket) Jev 0,870, Laya 0,425 alıyor. İngilizce checkpoint Latin dışı alfabelerde yüksek güvenle yanlış cevap veriyor; Router bunun için var. Türkçe için ayrı bir sonuç yayımlanmadı; Türkçe iş yükünde kendi verinle ölç.
Bağımsız bir karşılaştırma notu: Cloudflare'in Clef model kartındaki kendi Decision Index koşusunda Laya çoğu benchmark'ta Clef ve Jev'in çok gerisinde, ama medyan gecikmesi 5,8 ms ile en düşük. Bu ölçüm bir rakip tarafından ve Laya'nın hangi checkpoint/ayarla çalıştırıldığı belirtilmeden yapıldı; Convai'nin kendi tabloları daha olumlu. İkisini de kendi değerlendirmenle sına.
Karşılaştırma tablosu
Yalnızca birincil kaynaklardan doğrulanan hücreler dolduruldu; doğrulanamayanlar "—".
| Jev | Clef | Clef-flash | Laya | |
|---|---|---|---|---|
| Üretici | TypeSafe AI | Cloudflare | Cloudflare | Convai Innovations |
| Çıkış | 15 Eyl 2026 (erken erişim) | 1 Eki 2026 | 1 Eki 2026 | 18 Eyl 2026 (HF ve PyPI ilk sürüm) |
| Boyut | — (yayımlanmadı) | 27B (Qwen3.8-27B tabanlı) | 9B (Qwen3.5-9B tabanlı) | 421M (İngilizce) / 322M (çok dilli) |
| Ağırlıklar / lisans | Kapalı, yalnızca API | Açık, Apache 2.0 | Açık, Apache 2.0 | Açık, Apache 2.0 |
| Dağıtım | TypeSafe API | Workers AI ya da kendi GPU'n | Workers AI ya da kendi GPU'n | Kendi donanımın: Python, laya-serve, ONNX/Node |
| Girdi | Yalnızca metin/JSON | Metin, JSON, görsel, video | Metin, JSON, görsel, video | Metin/JSON |
| Bağlam | 64k (state + en uzun soru ≤ 32k) | 65.536 token | 65.536 token | 512 / 1.024 (çok dilli: 8.192'ye kadar) |
| Seçenek sınırı | choice başına 255 |
2–255; istekte en fazla 64 soru | 2–255; istekte en fazla 64 soru | ~20 seçenek önerilir; sunucuda üst sınır 100 |
| Diller | Birincil İngilizce, diğerleri daha zayıf | — | — | 100+ dil (çok dilli checkpoint) |
| Fiyat | 0,042 $ / M input token, output ücretsiz | 0,24 $ / M input token | 0,09 $ / M input token | Ücretsiz (kendi donanımın) |
| Gecikme iddiası | TypeSafe: 70–500 ms uçtan uca | Cloudflare: medyan 209,3 ms | Cloudflare: medyan 38,8 ms | Convai: ~33 ms/soru, toplu 7,2 ms/soru (T4) |
| Fine-tuning | Yok (müşteri başına ağırlık yok) | Cloudflare RL hizmeti (design partner) | Cloudflare RL hizmeti (design partner) | Açık notebook (2×T4) |
Kullanım senaryoları kataloğu
| Senaryo | Örnek sorular | Uygun model | Neden |
|---|---|---|---|
| Destek talebi triyajı | team (choice), urgent (noul), frustration (score), churn_risk (noul) |
Laya (yerel, ucuz), Clef-flash, Jev | Az seçenekli, metin ağırlıklı, yüksek hacimli; üç modelin de belgelediği ana senaryo |
| Ajan araç kapısı / yönlendirme | safe_to_run (noul), route (choice: kod / arama / insan), needs_approval (noul) |
Clef-flash, Laya | Ajan döngüsünün her adımında çalışacağı için gecikme kritik; Clef-flash'ın medyanı 38,8 ms, Laya yerelde onlarca ms |
| İçerik moderasyonu | policy (choice), severity (score), contains_threat (noul) |
Clef (görsel de varsa), Jev | Görsel içerik için Clef ve Clef-flash tek seçenek; düşük güvende insana devret |
| Dolandırıcılık / risk bayrakları | suspicious (noul), risk_level (score) |
Clef, Jev | Kararı ver ama tutar ve zaman hesabını kodda yap (Jev'in belgelenmiş zayıflığı); güven eşikli insan incelemesi şart |
| Oyun NPC kararları | action (choice: saldır / saklan / konuş), threat (score) |
Jev, Clef-flash, Laya | TypeSafe saniyede 10 sorguyla oynayan bir Doom demosu gösterdi; state yapılandırılmış veri olarak verildi, görüntü değil |
| Robotik | next_skill (choice), grasp_ok (noul) |
Clef / Clef-flash (görsel), Laya (cihazda) | Kamera karesini doğrudan okuyabilen tek açık modeller Clef ailesi; ancak düşük seviyeli kontrol klasik denetleyicide kalmalı |
| Form / belge sınıflandırma | doc_type (choice), is_signed (noul), legible (noul) |
Clef (taranmış belge), Jev / Laya (metin) | Clef model kartında fiş görselinden "toplam okunuyor mu?" örneği var |
| Potansiyel müşteri (lead) skorlama | fit (score), budget_mentioned (noul), segment (choice) |
Jev, Laya | Atomik sorularla skorla, ağırlıklandırmayı kodda yap (TypeSafe'in "composite scoring" kalıbı) |
İki genel kural: seçenek sayısı 20'yi geçiyorsa Laya yerine Jev ya da Clef'e bak (ya da önce adayları daralt); girdi görsel ya da video içeriyorsa şu an yalnızca Clef ailesi doğrudan okuyor.
LLM ile birlikte kullanmak: Sistem 1 kapı tutar, Sistem 2 düşünür
En verimli düzen genellikle şu: System One modeli her isteğe hızlıca bakar, çoğu basit vakayı kendisi karara bağlar ve yalnızca gerekenleri pahalı bir LLM'e ya da insana yollar. Cloudflare de Clef'i "ajanın istek yolunda" konumlandırıyor: önce Clef karar verir, sonra eylem için bir LLM'e devredilir.
// Cloudflare Worker: Clef-flash kapı tutar, LLM yalnızca gerektiğinde çağrılır.
// handleRefund, callLLM ve queueForHuman senin kendi fonksiyonların.
const decision = await env.AI.run("@cf/cloudflare/clef-flash", {
model: "clef-flash",
state: { ticket: ticketText, plan: customer.plan },
questions: {
intent: {
type: "choice",
instructions: "What does the customer want?",
criteria: {
refund: "Asks for money back for a specific charge",
how_to: "Asks how to use a feature",
bug: "Reports something broken",
other: "Anything else",
},
},
abusive: { type: "noul", instructions: "Is the message abusive or threatening?" },
},
});
const { intent, abusive } = decision.answers;
if (abusive.noul > 0.8) return queueForHuman(ticketText, "abuse"); // Güvenlik: insana
if (intent.confidence < 0.6) return callLLM(ticketText); // Emin değil: Sistem 2'ye
if (intent.choice === "refund") return handleRefund(ticketText); // Deterministik kod
return callLLM(ticketText, { hint: intent.choice }); // Yanıt yazmak LLM'in işiBuradaki eşikler (0,8 ve 0,6) örnek. Gerçek değerleri etiketli bir doğrulama setinde, "otomatik işlenen vaka oranı" ile "otomatik işlenenlerdeki hata oranı" arasındaki dengeye bakarak seçmelisin. Belirsiz vakaları insana yollamak klasik bir human-in-the-loop kalıbı; zararlı istekleri kapıda durdurmak ise bir guardrail.
Bu düzen ajan harness'larında da işe yarar: her araç çağrısından önce "bu komut yıkıcı mı?" sorusunu soran bir hook, ya da kullanıcı mesajını doğru alt-ajana yönlendiren bir router. TypeSafe'in kendi "skill suggestion" ve "guardrails for LLMs" tarifleri tam olarak bunu yapıyor.
Yerelde çalıştırma
Laya: dizüstü bilgisayarda bile
pip install "laya[serve]" # Python 3.10+
LAYA_DEVICE=cuda LAYA_PRELOAD=1 laya-serve # 0.0.0.0:8000, üç checkpoint'i önceden yükler
curl -s localhost:8000/v1/systemone -H 'content-type: application/json' -d '{
"state": {"body": "billed twice, refund please or we cancel"},
"questions": {"dept": {"type": "choice", "instructions": "which team?",
"criteria": {"billing": "refunds", "tech": "bugs"}}}
}'GPU yoksa LAYA_DEVICE=cpu kullan (ayarlanmazsa cihaz otomatik seçilir). Sunucu varsayılan olarak 0.0.0.0'a bağlanır; ağa açacaksan LAYA_API_KEY tanımla, istemciler o zaman Authorization: Bearer <key> göndermek zorunda kalır. README'ye göre Router(preload=True) GPU'da ~33 ms, CPU'da 193–464 ms veriyor. Node.js tarafında:
import { Laya } from "@receptron/laya"; // npm install @receptron/laya (Node 20+)
const laya = await Laya.load();
const result = await laya.systemOne(
{ subject: "Refund not received", body: "I cancelled two weeks ago and still have no refund..." },
{ churn_risk: { type: "noul", instructions: "Is the customer likely to cancel or dispute?" } },
);
console.log(result.answers.churn_risk.noul);
await laya.close();Donanım notu: Hugging Face model kartı İngilizce checkpoint için yaklaşık 808 MB, çok dilli için yaklaşık 647 MB indirme veriyor. Node paketi fp32 ONNX ağırlıklarını (~1,7 GB) indiriyor ve ~2 GB RAM öneriyor. Yani sıradan bir sunucu ya da dizüstü bilgisayar yeterli.
Clef: ciddi bir GPU gerekiyor
Clef'in model kartındaki referans kod torch 2.11 ve transformers 5.10.2 ile tek bir H200 üzerinde test edilmiş. Ağırlıklar bf16; Hugging Face deposu Clef için yaklaşık 55 GB, Clef-flash için yaklaşık 19 GB. Bizim kaba tahminimiz (ölçmedik): Clef için en az 80 GB'lık bir veri merkezi GPU'su, Clef-flash için 24 GB ve üstü bir GPU gerekir; uzun state'ler ve toplu işler ek bellek ister.
import sys
from huggingface_hub import snapshot_download
path = snapshot_download("Cloudflare/clef-flash")
sys.path.insert(0, path) # depo kendi model kodunu (joint_schema_model.py) içeriyor
from joint_schema_model import load_release_model, systemone
model, processor = load_release_model(path, device="cuda")
response = systemone(model, processor, {
"model": "clef-flash",
"state": "Our checkout started returning errors and orders are blocked.",
"questions": {
"outage": {"type": "noul", "instructions": "Is a service down?"},
"urgency": {"type": "score", "criteria": ["Can wait", "This week", "Today"]},
},
})
print(response["answers"])Depo kendi Python kodunu içerdiği için çalıştırmadan önce joint_schema_model.py'yi oku; bu, uzaktan kod çalıştırmak demek. Kendi GPU'n yoksa Workers AI'daki barındırılan sürüm çok daha az zahmetli.
Sınırlar ve tuzaklar
- Kalibrasyon kayması: Model eğitim dağılımında kalibre olabilir ama senin verinde, senin dilinde ya da birkaç ay sonra trafik değiştiğinde olmayabilir. Güvenilirlik diyagramını ve Brier skorunu düzenli ölç; Laya'nın kendi README'si İngilizce checkpoint'in Khmer dilinde %0 doğrulukla 0,952 güven verdiğini (sıcaklık sınırlaması öncesi ham değer; sunulan değer 0,705) belgeliyor.
- Etiket tasarımı: Model sorduğunu cevaplar, kastettiğini değil. Seçenek açıklamaları birbirini dışlamalı ve sınır vakaları içermeli. Bir "other" ya da "belirsiz" seçeneği eklemek, modelin uydurma bir kategoriye zorlanmasını önler. TypeSafe ayrıca seçenek sırasına duyarlılık bildiriyor: sırayı karıştırıp cevabın tutarlı kaldığını kontrol et.
- Alan kayması: Jev müşteri başına fine-tune edilmiyor; Clef için fine-tuning henüz bir ortaklık hizmeti; Laya'yı kendin fine-tune edebilirsin. Çok niş bir alanda (ör. hukuk ya da tıp jargonu) sıfırdan (zero-shot) sonuçlar hayal kırıklığı yaratabilir.
- Matematik, tarih, sayma: Bunları kodda yap. Modelden yalnızca yargı iste.
- Uzun ve gürültülü state: Alakasız ayrıntı doğruluğu düşürür. State'i soruya göre filtrele; Laya'nın bağlamı 512–1.024 token ile zaten kısa.
- Benchmark'lar üreticilerin: Hemen her sayı ilgili şirketin kendi koşusu; şirketler birbirini farklı ayarlarla ölçüyor. Kendi etiketli setinle karşılaştır.
- Olgunluk: Kategori birkaç haftalık. Jev erken erişimde ve oran limitleri değişkenlik gösteriyor; alias'lar (
jev-latest) yeni sürümde sessizce değişebiliyor. Sürüm sabitle,modelalanını logla.
Kontrol listesi
Uygunluk
- Cevap kümesi önceden tanımlanabiliyor mu (seçenek, rubrik ya da evet/hayır)?
- Karar "uzmanın birkaç saniyede vereceği" türden mi, yoksa çok adımlı akıl yürütme mi gerekiyor?
- Hesap, sayma ve tarih karşılaştırması kodda mı?
Model seçimi
- Veri dışarı çıkabilir mi? Çıkamıyorsa: Laya ya da kendi GPU'nda Clef.
- Görsel/video girdisi var mı? Varsa: Clef ailesi.
- 20'den fazla seçenek var mı? Varsa: Jev ya da Clef, veya önce adayları daralt.
- İngilizce dışı (ör. Türkçe) içerik var mı? Kendi verinle ayrı ölç.
Soru tasarımı
- Her soru tek ve atomik bir şey mi soruyor?
- Seçenekler birbirini dışlıyor mu, bir "other/belirsiz" seçeneği var mı?
- Seçenek sırası karıştırıldığında cevap tutarlı mı?
Kalibrasyon ve eşikler
- En az birkaç yüz etiketli örnekten oluşan bir doğrulama setin var mı?
- Güven eşikleri bu modelde, bu soru ifadesiyle ayarlandı mı (başka modelden taşınmadı)?
- Düşük güvenli vakalar insana ya da büyük bir LLM'e gidiyor mu?
Üretim
- Model sürümü sabitlendi mi, yanıttaki
modelalanı loglanıyor mu? - Kalibrasyon ve otomatik karar oranı düzenli izleniyor mu?
- Oran limitine (429) karşı yeniden deneme ve yedek yol var mı?
Devamı için
- System One Model — kavramın kısa tanımı.
- Reasoning Model ve LLM — Sistem 2 tarafı.
- Agent Loop, AI Agent ve Function Calling — kapı tutmanın gerçekleştiği yer.
- Human-in-the-loop ve Guardrails — belirsiz ve riskli vakaları yönetmek.
- Classification — klasik sınıflandırmayla farkı görmek için.
- Bir AI Harness'ının Anatomisi — System One kapılarının takılabileceği yer.