Sıfırdan kurulan ve eğitilen açık kaynak bir Türkçe dil modeli: kendi mimarisi, kendi tokenizer'ı, kendi ağırlıkları.

Rol

Geliştirici ve proje sahibi

Bağlam

Açık kaynak araştırma projesi

Dönem

2026 — devam ediyor

Platform

Python · PyTorch · CUDA, Apple Silicon (MPS), CPU

Bağlantılar

Türkçe dil modellerinin çoğu, Türkçe metinle ince ayar yapılmış İngilizce merkezli modellerdir. Ünlü uyumu ve zengin morfolojisi olan sondan eklemeli bir dil için hiç tasarlanmamış bir tokenizer'ı ve mimariyi devralırlar. Toprak farklı bir soru sorar: başlangıç noktası Türkçe olduğunda model nasıl görünür?

Hiçbir mevcut modelden ince ayar yapılmıyor. Proje tüm hattı içeriyor: kaynak ve lisans bilgisi tutulan veri toplama ve temizleme, 32.000 tokenlık Türkçe BPE tokenizer, modern bir decoder-only transformer, eğitim döngüsü, çıkarım ve değerlendirme paketi. Türkçeye özgü eğitim hedefleri isteğe bağlı yardımcı kayıplar olarak uygulanıyor; böylece etkileri ablation çalışmalarıyla ölçülebiliyor.

  1. 01

    Modern decoder-only mimari

    RMSNorm, SwiGLU, döner konum gömmeleri (RoPE) ve KV önbellekli gruplu sorgu dikkati (GQA).

  2. 02

    Dört model boyutu

    Yaklaşık 80 milyondan 941 milyon parametreye uzanan yapılandırmalar.

  3. 03

    Türkçe tokenizer

    Kapsam, fertility ve morfoloji analiziyle birlikte 32K SentencePiece BPE sözlüğü.

  4. 04

    Türkçeye özgü hedefler

    Ünlü uyumu, ünsüz benzeşmesi, morfoloji ile hece ölçüsü ve kafiye için isteğe bağlı yardımcı kayıplar.

  5. 05

    Veri yönetişimi ve değerlendirme

    Kalite, kişisel veri ve tekrar filtreleri, kaynak kayıtları ve çok boyutlu deterministik değerlendirme paketi.

Toprak, Apache 2.0 lisansıyla yayınlanıyor ve aktif olarak geliştiriliyor. Kod, mimari ve eğitim süreci tamamen açık; deneyleri tekrarlamak, tokenizer karşılaştırmak ve ablation çalıştırmak için rehberler mevcut.

Yapay zekâ destekli araç pazaryeri

Yapay zekâ · Otomotiv