AI Atlas
Tüm rehberler
⚡ REHBER

System One Modelleri: Jev, Clef ve Laya — Ne İşe Yarar, Nerede Kullanılır?

Metin üretmeden, tek geçişte kalibre olasılıklarla karar veren yeni model sınıfı: nasıl çalışır, Jev, Clef/Clef-flash ve Laya arasındaki farklar, kullanım senaryoları, LLM ile birlikte kullanım, yerelde çalıştırma ve tuzaklar.

System One Jev Clef Laya Agents

Kısa özet

Eylül–Ekim 2026'da yeni bir model sınıfı ortaya çıktı: System One modelleri. Bunlar metin üretmez. Onlara bir state (metin, JSON, ticket, e-posta; bazılarında görsel) ve tipli sorular verirsin; model izin verilen her cevabın olasılığını tek bir forward pass'te döndürür. Kodun bu sayılara bakıp dallanır.

Bu rehberde üç önemli örneği inceliyoruz: TypeSafe AI'ın kategoriyi başlatan Jev'i, Cloudflare'in açık ağırlıklı Clef ve Clef-flash'ı ve Convai Innovations'ın küçük, yerelde çalışan Laya'sı. Sonda bir karşılaştırma tablosu, senaryo kataloğu, LLM ile birlikte kullanım örneği ve bir kontrol listesi var.

Not: Bilgiler 5 Ekim 2026 itibarıyla üreticilerin kendi blog yazıları, dokümantasyonu, Hugging Face model kartları ve GitHub README'lerinden kontrol edildi. Hız, maliyet ve doğruluk rakamlarının neredeyse tamamı üreticilerin kendi ölçümleri; metinde kime ait olduğunu belirttik. Kategori birkaç haftalık; ayrıntılar hızla değişiyor.

Hangi sorunu çözüyorlar?

Yazılımın içinde sürekli küçük kararlar veririz: bu destek talebi hangi ekibe gider, bu mesaj acil mi, bu araç çağrısı güvenli mi, bu yorum moderasyona takılmalı mı? Bugün bunun için genellikle bir LLM'e "şu JSON formatında cevap ver" deriz. Bu yaklaşımın üç sorunu var:

  • Yavaş ve pahalı: LLM cevabı token token üretir. Kısa bir JSON bile birkaç düzine sıralı adım demektir; reasoning açıksa üstüne görünmez düşünme token'ları eklenir.
  • Kırılgan: Çıktı metindir. Ayrıştırırsın, doğrularsın, bazen yeniden denersin. Şemaya uymayan, var olmayan bir seçenek uyduran cevaplar mümkündür.
  • Belirsizliği söylemez: LLM'e "ne kadar eminsin?" diye sorabilirsin ama TypeSafe'in tanıtım yazısında belirttiği gibi modeller bu konuda genellikle aşırı özgüvenli ve tutarsız. Bir görevi %95 doğru yapan ama hangi %5'te yanıldığını söylemeyen bir model o görevi otomatikleştiremez.

System One modelleri bu üç noktayı hedefliyor: cevap kümesini önceden sen tanımlarsın, model her seçeneği tek geçişte olasılıkla puanlar, sen de olasılığa göre "otomatik uygula", "insana sor" ya da "büyük modele devret" diye dallanırsın.

Nasıl çalışırlar?

Tipli sorular

Üç model de aynı üç soru tipini kullanıyor (TypeSafe dokümantasyonu, Cloudflare Workers AI şeması ve Laya README'si aynı tanımları veriyor):

Tip Ne sorar Ne döner
choice Tanımladığın seçeneklerden hangisi? choice (en olası seçenek), seçenek başına probabilities, confidence
score Sıralı bir rubrikte hangi seviyede? score (olasılık ağırlıklı seviye, iki seviye arasında çıkabilir), seviye başına probabilities, confidence, legend
noul Evet/hayır sorusu doğru mu? noul: "evet" olasılığı (0–1)

Bir istekte birden çok soru gönderilir ve hepsi aynı state'e karşı değerlendirilir. İstek gövdesi üç modelde de aynı iskelete sahip:

{
  "model": "jev-latest",
  "state": "Hi, I've been trying to connect my Stripe account for 3 days and the integration keeps failing. I'm losing sales. Please help ASAP.",
  "questions": {
    "department": {
      "type": "choice",
      "instructions": "Which team should handle this",
      "criteria": {
        "billing": "Payment or subscription issues",
        "technical": "Bugs or integration problems",
        "sales": "Pricing or account questions"
      }
    },
    "frustration": {
      "type": "score",
      "instructions": "How frustrated the customer appears",
      "criteria": ["Calm, just stating facts", "Frustrated but civil", "Very angry, strong language"]
    },
    "is_urgent": { "type": "noul", "instructions": "The message conveys urgency or time-sensitivity" }
  }
}

TypeSafe'in hızlı başlangıç sayfasındaki örnek yanıtta department için "choice": "technical", "probabilities": {"technical": 0.85, "billing": 0.15, "sales": 0.0} ve "confidence": 0.78 dönüyor. Soru anahtarlarını (department, is_urgent) sen seçersin; cevaplar aynı anahtarlarla gelir.

Tek geçiş

LLM'de her yeni token bir önceki token'a bağlı olarak sırayla üretilir. System One modelinde ise tüm soruların tüm seçenekleri bir kerede puanlanır. Mimari üreticiye göre değişiyor:

  • Clef, Qwen tabanlı bir omurganın üstüne küçük bir "joint schema head" ekliyor; bu kafa omurganın son gizli durumlarını okuyup her sorunun her seçeneği için bir logit üretiyor, soru başına softmax ile olasılığa çevriliyor (Hugging Face model kartı).
  • Laya, ModernBERT/mmBERT gibi bir encoder ve üstünde bir karar kafası kullanıyor (receptron/laya README'si).
  • Jev'in mimarisi yayımlanmadı; TypeSafe yalnızca "yeni bir model mimarisi ve paralel örnekleyici" kullandığını söylüyor.

TypeSafe dokümantasyonuna göre soru eklemek yanıt süresini neredeyse değiştirmiyor ve her soru bağımsız değerlendirildiği için soru sayısı arttıkça "context rot" oluşmuyor.

Kalibrasyon

Kalibre bir model için "0.8 olasılık" dediği vakaların yaklaşık %80'inde haklı çıkması gerekir. TypeSafe bunun için RLCD (Reinforcement Learning for Calibrated Decisions) adını verdiği bir eğitim yöntemi kullandığını söylüyor. Laya da RLCD adını kullanıyor ve "strictly proper scoring rule"lara karşı pekiştirmeli öğrenmeyle eğitildiğini belirtiyor. Cloudflare ise Clef'i etiket yumuşatmalı cross-entropy ve kalibrasyon için Brier loss ile eğittiğini yazıyor.

Bunlar üreticilerin iddiası. Kalibrasyon dağılıma bağlıdır: senin verinde, senin soru ifadenle ve senin dilinde ölçmeden güvenme. Bunun nasıl yapılacağı aşağıdaki kontrol listesinde.

Güven (confidence) her modelde aynı şey değil

API sözleşmesi aynı olsa da confidence alanının formülü farklı. Jev (ve TypeSafe dokümantasyonu) choice için (n·p_max − 1)/(n − 1) kullanıyor. Laya'nın README'si kendi confidence değerinin "1 − normalize entropi" olduğunu ve Jev'den taşınan eşiklerin geçerli olmadığını açıkça yazıyor. Model değiştirirken eşikleri yeniden ölç.

Jev (TypeSafe AI)

TypeSafe AI, Jev'i 15 Eylül 2026'da kurucu Diogo Almeida'nın tanıtım yazısıyla erken erişimde duyurdu. Model kapalı ağırlıklı ve yalnızca TypeSafe'in API'si üzerinden kullanılıyor.

  • Uç nokta: POST https://api.typesafe.ai/v1/systemone, Authorization: Bearer <API_KEY>. Model adı olarak jev-latest alias'ı kullanılıyor; 5 Ekim itibarıyla bu jev-1.13.0'a işaret ediyor.
  • Fiyat: Milyon input token başına 0,042 $; output token'lar ücretsiz (Models sayfası).
  • Sınırlar: İstek başına 64k token; state ile en uzun soru toplamda 32k. Yalnızca metin girdisi (string, JSON nesnesi ya da metin dizisi); görsel, ses ya da video yok. choice başına en fazla 255 seçenek. Oran limitleri dokümantasyonda 100K token/sn ve 80 istek/sn olarak verilmiş, ama TypeSafe bu limitlerin talebe göre haber vermeden değişebileceğini yazıyor.
  • Dil: Birincil eğitim dili İngilizce; diğer diller "işleniyor ama aynı kalitede değil". TypeSafe, İngilizce dışı işlerde önce kendi içeriğinle test etmeni öneriyor.
  • Özelleştirme: Jev müşteri verisiyle fine-tune edilmiyor; herkes aynı ağırlıkları kullanıyor. Alana uyarlamayı state, instructions ve criteria üzerinden yapıyorsun.
  • SDK: Python (pip install typesafe-sdk) ve JavaScript (@typesafe-ai/sdk) istemcileri var.

TypeSafe'in iddiaları: Tanıtım yazısına göre Jev, System One görevlerinde mevcut LLM'lerle benzer zekâ seviyesinde ama "iki büyüklük mertebesi" daha hızlı ve verimli; uçtan uca yanıt süresi 70–500 ms. Ana sayfadaki "193,6 kat daha hızlı, 444,6 kat daha ucuz" rakamlarının kendi workflow değerlendirmelerinden geldiğini ve bunların "gerçek dünya kazançlarının üst ucunda" olduğunu yazının kendisi belirtiyor. TypeSafe, referans cevap olarak başka şirketlerin büyük modellerinin ortalamasını kullandığını ve değerlendirmeleri kendi ekibinin hazırladığını da not ediyor.

Bilinen zayıflıklar: TypeSafe'in "Jev 1.13 jaggedness" sayfası dürüst bir liste veriyor: talimatları harfiyen okuma, sayma ve aritmetik, tarih karşılaştırması, çok katmanlı dolaylı sorular, alakasız ayrıntıyla dolu büyük state'ler, çelişen talimat/kriterler, choice seçeneklerinin sırasına duyarlılık ve tabii ki metin üretimi. Önerisi net: matematiği ve tarih hesabını kodda yap, modele yalnızca yargı gerektiren kısmı sor.

Clef ve Clef-flash (Cloudflare)

Cloudflare 1 Ekim 2026'da Workers AI ekibinin eğittiği ilk modelleri duyurdu: @cf/cloudflare/clef ve @cf/cloudflare/clef-flash. İkisi de Jev ile aynı model ailesinde ve Jev API'si ile uyumlu; Cloudflare mevcut bir Jev entegrasyonunu uç noktayı ve model adını değiştirerek taşıyabileceğini söylüyor.

  • Boyut ve temel model: Clef 27B parametreli, Qwen3.8-27B'den; Clef-flash 9B, Qwen3.5-9B'den post-train edilmiş. Blog yazısına göre omurga dondurulmuş, rank-256 LoRA adaptörleri ve karar kafası birlikte eğitilmiş.
  • Lisans: Ağırlıklar Hugging Face'te Apache 2.0 ile açık (Cloudflare/clef, Cloudflare/clef-flash).
  • Girdi: Metin, JSON, görsel ve video (model kartı). Workers AI'da görseller images alanıyla gömülü olarak gönderiliyor (en fazla 4; uzak URL kabul edilmiyor).
  • Sınırlar (Workers AI şeması): İstek başına 1–64 soru; choice için 2–255 seçenek; score için 2–10 seviye; bağlam penceresi 65.536 token.
  • Fiyat (Workers AI): Clef milyon input token başına 0,24 $, Clef-flash 0,09 $.
  • Fine-tuning: Cloudflare aynı gün bir RL fine-tuning hizmeti duyurdu; şimdilik "design partner" olarak, kendi mühendis ekibiyle birlikte yürütülüyor.

Cloudflare'in iddiaları: 43 benchmark koşusunda medyan gecikme Clef için 209,3 ms, Clef-flash için 38,8 ms, Jev için 524,1 ms (p95: 238,6 / 122,4 / 536,0 ms). Cloudflare'e göre 10 karar benchmark'ının 7'sinde en yüksek skoru bir Clef modeli alıyor; TypeSafe'in kendi workflow değerlendirmelerinde de Clef dört alanın üçünde Jev'i geçiyor. Model kartındaki geniş tablo daha karışık bir resim çiziyor: GPQA Diamond, MMLU-Pro ve BBH gibi akıl yürütme ağırlıklı testlerde Jev belirgin biçimde önde. Yani "Clef her şeyde daha iyi" değil; görev tipine göre değişiyor.

Laya (Convai Innovations)

Laya, Convai Innovations'ın açık ağırlıklı, Apache 2.0 lisanslı System One modeli. Hugging Face deposu ve PyPI'daki ilk laya sürümü 18 Eylül 2026 tarihli. Diğer ikisinden farkı boyut: milyarlarca değil, yüz milyonlarca parametre.

Checkpoint Encoder Parametre Bağlam Ne için
laya ModernBERT-large 421M 512 İngilizce
laya-multilingual mmBERT-base 322M 1.024 (8.192'ye kadar) 100+ dil
laya-typed-decisions ModernBERT-large 421M 1.024 Tipli karar workflow'ları (fine-tune edilmiş)
  • Router: laya paketindeki Router, metnin alfabesini ve dilini tespit edip isteği İngilizce ya da çok dilli checkpoint'e yolluyor.
  • Jev uyumlu sunucu: laya-serve, Jev ile aynı POST /v1/systemone sözleşmesini sunuyor; README'ye göre mevcut bir Jev istemcisinin yalnızca baseUrl'ini değiştirmek yetiyor.
  • Node/TypeScript: @receptron/laya paketi modeli ONNX Runtime ile çalıştırıyor; çalışma anında Python ya da PyTorch gerekmiyor.
  • Fine-tuning: Kaggle'ın ücretsiz 2×T4 GPU'larında çalışan bir fine-tuning notebook'u var. Model kartına göre fine-tune edilmiş laya-typed-decisions, aynı 2.000 kararda temel İngilizce checkpoint'in 0,362'lik doğruluğunu 0,766'ya çıkarıyor.

Convai'nin iddiaları: Tek soru için yaklaşık 33 ms, toplu çalıştırmada soru başına 7,2 ms (T4 GPU üzerinde ölçülmüş). receptron README'sine göre Node paketiyle üç soruluk bir çağrı, model ısındıktan sonra Apple Silicon CPU'da yaklaşık 140 ms sürüyor.

Dürüst sınırlar (README'nin kendisinden): Seçenekler sabit bir token bütçesini paylaşıyor (İngilizce checkpoint'te 192, diğerlerinde 256 token), bu yüzden yaklaşık 20 seçeneğin üstünde doğruluk belirgin düşüyor; Banking77'de (72–77 etiket) Jev 0,870, Laya 0,425 alıyor. İngilizce checkpoint Latin dışı alfabelerde yüksek güvenle yanlış cevap veriyor; Router bunun için var. Türkçe için ayrı bir sonuç yayımlanmadı; Türkçe iş yükünde kendi verinle ölç.

Bağımsız bir karşılaştırma notu: Cloudflare'in Clef model kartındaki kendi Decision Index koşusunda Laya çoğu benchmark'ta Clef ve Jev'in çok gerisinde, ama medyan gecikmesi 5,8 ms ile en düşük. Bu ölçüm bir rakip tarafından ve Laya'nın hangi checkpoint/ayarla çalıştırıldığı belirtilmeden yapıldı; Convai'nin kendi tabloları daha olumlu. İkisini de kendi değerlendirmenle sına.

Karşılaştırma tablosu

Yalnızca birincil kaynaklardan doğrulanan hücreler dolduruldu; doğrulanamayanlar "—".

Jev Clef Clef-flash Laya
Üretici TypeSafe AI Cloudflare Cloudflare Convai Innovations
Çıkış 15 Eyl 2026 (erken erişim) 1 Eki 2026 1 Eki 2026 18 Eyl 2026 (HF ve PyPI ilk sürüm)
Boyut — (yayımlanmadı) 27B (Qwen3.8-27B tabanlı) 9B (Qwen3.5-9B tabanlı) 421M (İngilizce) / 322M (çok dilli)
Ağırlıklar / lisans Kapalı, yalnızca API Açık, Apache 2.0 Açık, Apache 2.0 Açık, Apache 2.0
Dağıtım TypeSafe API Workers AI ya da kendi GPU'n Workers AI ya da kendi GPU'n Kendi donanımın: Python, laya-serve, ONNX/Node
Girdi Yalnızca metin/JSON Metin, JSON, görsel, video Metin, JSON, görsel, video Metin/JSON
Bağlam 64k (state + en uzun soru ≤ 32k) 65.536 token 65.536 token 512 / 1.024 (çok dilli: 8.192'ye kadar)
Seçenek sınırı choice başına 255 2–255; istekte en fazla 64 soru 2–255; istekte en fazla 64 soru ~20 seçenek önerilir; sunucuda üst sınır 100
Diller Birincil İngilizce, diğerleri daha zayıf — — 100+ dil (çok dilli checkpoint)
Fiyat 0,042 $ / M input token, output ücretsiz 0,24 $ / M input token 0,09 $ / M input token Ücretsiz (kendi donanımın)
Gecikme iddiası TypeSafe: 70–500 ms uçtan uca Cloudflare: medyan 209,3 ms Cloudflare: medyan 38,8 ms Convai: ~33 ms/soru, toplu 7,2 ms/soru (T4)
Fine-tuning Yok (müşteri başına ağırlık yok) Cloudflare RL hizmeti (design partner) Cloudflare RL hizmeti (design partner) Açık notebook (2×T4)

Kullanım senaryoları kataloğu

Senaryo Örnek sorular Uygun model Neden
Destek talebi triyajı team (choice), urgent (noul), frustration (score), churn_risk (noul) Laya (yerel, ucuz), Clef-flash, Jev Az seçenekli, metin ağırlıklı, yüksek hacimli; üç modelin de belgelediği ana senaryo
Ajan araç kapısı / yönlendirme safe_to_run (noul), route (choice: kod / arama / insan), needs_approval (noul) Clef-flash, Laya Ajan döngüsünün her adımında çalışacağı için gecikme kritik; Clef-flash'ın medyanı 38,8 ms, Laya yerelde onlarca ms
İçerik moderasyonu policy (choice), severity (score), contains_threat (noul) Clef (görsel de varsa), Jev Görsel içerik için Clef ve Clef-flash tek seçenek; düşük güvende insana devret
Dolandırıcılık / risk bayrakları suspicious (noul), risk_level (score) Clef, Jev Kararı ver ama tutar ve zaman hesabını kodda yap (Jev'in belgelenmiş zayıflığı); güven eşikli insan incelemesi şart
Oyun NPC kararları action (choice: saldır / saklan / konuş), threat (score) Jev, Clef-flash, Laya TypeSafe saniyede 10 sorguyla oynayan bir Doom demosu gösterdi; state yapılandırılmış veri olarak verildi, görüntü değil
Robotik next_skill (choice), grasp_ok (noul) Clef / Clef-flash (görsel), Laya (cihazda) Kamera karesini doğrudan okuyabilen tek açık modeller Clef ailesi; ancak düşük seviyeli kontrol klasik denetleyicide kalmalı
Form / belge sınıflandırma doc_type (choice), is_signed (noul), legible (noul) Clef (taranmış belge), Jev / Laya (metin) Clef model kartında fiş görselinden "toplam okunuyor mu?" örneği var
Potansiyel müşteri (lead) skorlama fit (score), budget_mentioned (noul), segment (choice) Jev, Laya Atomik sorularla skorla, ağırlıklandırmayı kodda yap (TypeSafe'in "composite scoring" kalıbı)

İki genel kural: seçenek sayısı 20'yi geçiyorsa Laya yerine Jev ya da Clef'e bak (ya da önce adayları daralt); girdi görsel ya da video içeriyorsa şu an yalnızca Clef ailesi doğrudan okuyor.

LLM ile birlikte kullanmak: Sistem 1 kapı tutar, Sistem 2 düşünür

En verimli düzen genellikle şu: System One modeli her isteğe hızlıca bakar, çoğu basit vakayı kendisi karara bağlar ve yalnızca gerekenleri pahalı bir LLM'e ya da insana yollar. Cloudflare de Clef'i "ajanın istek yolunda" konumlandırıyor: önce Clef karar verir, sonra eylem için bir LLM'e devredilir.

// Cloudflare Worker: Clef-flash kapı tutar, LLM yalnızca gerektiğinde çağrılır.
// handleRefund, callLLM ve queueForHuman senin kendi fonksiyonların.
const decision = await env.AI.run("@cf/cloudflare/clef-flash", {
  model: "clef-flash",
  state: { ticket: ticketText, plan: customer.plan },
  questions: {
    intent: {
      type: "choice",
      instructions: "What does the customer want?",
      criteria: {
        refund: "Asks for money back for a specific charge",
        how_to: "Asks how to use a feature",
        bug: "Reports something broken",
        other: "Anything else",
      },
    },
    abusive: { type: "noul", instructions: "Is the message abusive or threatening?" },
  },
});

const { intent, abusive } = decision.answers;

if (abusive.noul > 0.8) return queueForHuman(ticketText, "abuse");      // Güvenlik: insana
if (intent.confidence < 0.6) return callLLM(ticketText);                // Emin değil: Sistem 2'ye
if (intent.choice === "refund") return handleRefund(ticketText);       // Deterministik kod
return callLLM(ticketText, { hint: intent.choice });                    // Yanıt yazmak LLM'in işi

Buradaki eşikler (0,8 ve 0,6) örnek. Gerçek değerleri etiketli bir doğrulama setinde, "otomatik işlenen vaka oranı" ile "otomatik işlenenlerdeki hata oranı" arasındaki dengeye bakarak seçmelisin. Belirsiz vakaları insana yollamak klasik bir human-in-the-loop kalıbı; zararlı istekleri kapıda durdurmak ise bir guardrail.

Bu düzen ajan harness'larında da işe yarar: her araç çağrısından önce "bu komut yıkıcı mı?" sorusunu soran bir hook, ya da kullanıcı mesajını doğru alt-ajana yönlendiren bir router. TypeSafe'in kendi "skill suggestion" ve "guardrails for LLMs" tarifleri tam olarak bunu yapıyor.

Yerelde çalıştırma

Laya: dizüstü bilgisayarda bile

pip install "laya[serve]"                     # Python 3.10+
LAYA_DEVICE=cuda LAYA_PRELOAD=1 laya-serve    # 0.0.0.0:8000, üç checkpoint'i önceden yükler

curl -s localhost:8000/v1/systemone -H 'content-type: application/json' -d '{
  "state": {"body": "billed twice, refund please or we cancel"},
  "questions": {"dept": {"type": "choice", "instructions": "which team?",
                "criteria": {"billing": "refunds", "tech": "bugs"}}}
}'

GPU yoksa LAYA_DEVICE=cpu kullan (ayarlanmazsa cihaz otomatik seçilir). Sunucu varsayılan olarak 0.0.0.0'a bağlanır; ağa açacaksan LAYA_API_KEY tanımla, istemciler o zaman Authorization: Bearer <key> göndermek zorunda kalır. README'ye göre Router(preload=True) GPU'da ~33 ms, CPU'da 193–464 ms veriyor. Node.js tarafında:

import { Laya } from "@receptron/laya"; // npm install @receptron/laya (Node 20+)

const laya = await Laya.load();
const result = await laya.systemOne(
  { subject: "Refund not received", body: "I cancelled two weeks ago and still have no refund..." },
  { churn_risk: { type: "noul", instructions: "Is the customer likely to cancel or dispute?" } },
);
console.log(result.answers.churn_risk.noul);
await laya.close();

Donanım notu: Hugging Face model kartı İngilizce checkpoint için yaklaşık 808 MB, çok dilli için yaklaşık 647 MB indirme veriyor. Node paketi fp32 ONNX ağırlıklarını (~1,7 GB) indiriyor ve ~2 GB RAM öneriyor. Yani sıradan bir sunucu ya da dizüstü bilgisayar yeterli.

Clef: ciddi bir GPU gerekiyor

Clef'in model kartındaki referans kod torch 2.11 ve transformers 5.10.2 ile tek bir H200 üzerinde test edilmiş. Ağırlıklar bf16; Hugging Face deposu Clef için yaklaşık 55 GB, Clef-flash için yaklaşık 19 GB. Bizim kaba tahminimiz (ölçmedik): Clef için en az 80 GB'lık bir veri merkezi GPU'su, Clef-flash için 24 GB ve üstü bir GPU gerekir; uzun state'ler ve toplu işler ek bellek ister.

import sys
from huggingface_hub import snapshot_download

path = snapshot_download("Cloudflare/clef-flash")
sys.path.insert(0, path)  # depo kendi model kodunu (joint_schema_model.py) içeriyor
from joint_schema_model import load_release_model, systemone

model, processor = load_release_model(path, device="cuda")
response = systemone(model, processor, {
    "model": "clef-flash",
    "state": "Our checkout started returning errors and orders are blocked.",
    "questions": {
        "outage": {"type": "noul", "instructions": "Is a service down?"},
        "urgency": {"type": "score", "criteria": ["Can wait", "This week", "Today"]},
    },
})
print(response["answers"])

Depo kendi Python kodunu içerdiği için çalıştırmadan önce joint_schema_model.py'yi oku; bu, uzaktan kod çalıştırmak demek. Kendi GPU'n yoksa Workers AI'daki barındırılan sürüm çok daha az zahmetli.

Sınırlar ve tuzaklar

  • Kalibrasyon kayması: Model eğitim dağılımında kalibre olabilir ama senin verinde, senin dilinde ya da birkaç ay sonra trafik değiştiğinde olmayabilir. Güvenilirlik diyagramını ve Brier skorunu düzenli ölç; Laya'nın kendi README'si İngilizce checkpoint'in Khmer dilinde %0 doğrulukla 0,952 güven verdiğini (sıcaklık sınırlaması öncesi ham değer; sunulan değer 0,705) belgeliyor.
  • Etiket tasarımı: Model sorduğunu cevaplar, kastettiğini değil. Seçenek açıklamaları birbirini dışlamalı ve sınır vakaları içermeli. Bir "other" ya da "belirsiz" seçeneği eklemek, modelin uydurma bir kategoriye zorlanmasını önler. TypeSafe ayrıca seçenek sırasına duyarlılık bildiriyor: sırayı karıştırıp cevabın tutarlı kaldığını kontrol et.
  • Alan kayması: Jev müşteri başına fine-tune edilmiyor; Clef için fine-tuning henüz bir ortaklık hizmeti; Laya'yı kendin fine-tune edebilirsin. Çok niş bir alanda (ör. hukuk ya da tıp jargonu) sıfırdan (zero-shot) sonuçlar hayal kırıklığı yaratabilir.
  • Matematik, tarih, sayma: Bunları kodda yap. Modelden yalnızca yargı iste.
  • Uzun ve gürültülü state: Alakasız ayrıntı doğruluğu düşürür. State'i soruya göre filtrele; Laya'nın bağlamı 512–1.024 token ile zaten kısa.
  • Benchmark'lar üreticilerin: Hemen her sayı ilgili şirketin kendi koşusu; şirketler birbirini farklı ayarlarla ölçüyor. Kendi etiketli setinle karşılaştır.
  • Olgunluk: Kategori birkaç haftalık. Jev erken erişimde ve oran limitleri değişkenlik gösteriyor; alias'lar (jev-latest) yeni sürümde sessizce değişebiliyor. Sürüm sabitle, model alanını logla.

Kontrol listesi

Uygunluk

  • Cevap kümesi önceden tanımlanabiliyor mu (seçenek, rubrik ya da evet/hayır)?
  • Karar "uzmanın birkaç saniyede vereceği" türden mi, yoksa çok adımlı akıl yürütme mi gerekiyor?
  • Hesap, sayma ve tarih karşılaştırması kodda mı?

Model seçimi

  • Veri dışarı çıkabilir mi? Çıkamıyorsa: Laya ya da kendi GPU'nda Clef.
  • Görsel/video girdisi var mı? Varsa: Clef ailesi.
  • 20'den fazla seçenek var mı? Varsa: Jev ya da Clef, veya önce adayları daralt.
  • İngilizce dışı (ör. Türkçe) içerik var mı? Kendi verinle ayrı ölç.

Soru tasarımı

  • Her soru tek ve atomik bir şey mi soruyor?
  • Seçenekler birbirini dışlıyor mu, bir "other/belirsiz" seçeneği var mı?
  • Seçenek sırası karıştırıldığında cevap tutarlı mı?

Kalibrasyon ve eşikler

  • En az birkaç yüz etiketli örnekten oluşan bir doğrulama setin var mı?
  • Güven eşikleri bu modelde, bu soru ifadesiyle ayarlandı mı (başka modelden taşınmadı)?
  • Düşük güvenli vakalar insana ya da büyük bir LLM'e gidiyor mu?

Üretim

  • Model sürümü sabitlendi mi, yanıttaki model alanı loglanıyor mu?
  • Kalibrasyon ve otomatik karar oranı düzenli izleniyor mu?
  • Oran limitine (429) karşı yeniden deneme ve yedek yol var mı?

Devamı için