Açık kaynak · Yapay zekâ araştırması
Sıfırdan kurulan ve eğitilen açık kaynak bir Türkçe dil modeli: kendi mimarisi, kendi tokenizer'ı, kendi ağırlıkları.
Rol
Geliştirici ve proje sahibi
Bağlam
Açık kaynak araştırma projesi
Dönem
2026 — devam ediyor
Platform
Python · PyTorch · CUDA, Apple Silicon (MPS), CPU
Bağlantılar
Problem
Türkçe dil modellerinin çoğu, Türkçe metinle ince ayar yapılmış İngilizce merkezli modellerdir. Ünlü uyumu ve zengin morfolojisi olan sondan eklemeli bir dil için hiç tasarlanmamış bir tokenizer'ı ve mimariyi devralırlar. Toprak farklı bir soru sorar: başlangıç noktası Türkçe olduğunda model nasıl görünür?
Yaklaşım
Hiçbir mevcut modelden ince ayar yapılmıyor. Proje tüm hattı içeriyor: kaynak ve lisans bilgisi tutulan veri toplama ve temizleme, 32.000 tokenlık Türkçe BPE tokenizer, modern bir decoder-only transformer, eğitim döngüsü, çıkarım ve değerlendirme paketi. Türkçeye özgü eğitim hedefleri isteğe bağlı yardımcı kayıplar olarak uygulanıyor; böylece etkileri ablation çalışmalarıyla ölçülebiliyor.
Neler geliştirildi
- 01
Modern decoder-only mimari
RMSNorm, SwiGLU, döner konum gömmeleri (RoPE) ve KV önbellekli gruplu sorgu dikkati (GQA).
- 02
Dört model boyutu
Yaklaşık 80 milyondan 941 milyon parametreye uzanan yapılandırmalar.
- 03
Türkçe tokenizer
Kapsam, fertility ve morfoloji analiziyle birlikte 32K SentencePiece BPE sözlüğü.
- 04
Türkçeye özgü hedefler
Ünlü uyumu, ünsüz benzeşmesi, morfoloji ile hece ölçüsü ve kafiye için isteğe bağlı yardımcı kayıplar.
- 05
Veri yönetişimi ve değerlendirme
Kalite, kişisel veri ve tekrar filtreleri, kaynak kayıtları ve çok boyutlu deterministik değerlendirme paketi.
Sonuç
Toprak, Apache 2.0 lisansıyla yayınlanıyor ve aktif olarak geliştiriliyor. Kod, mimari ve eğitim süreci tamamen açık; deneyleri tekrarlamak, tokenizer karşılaştırmak ve ablation çalıştırmak için rehberler mevcut.
Sonraki proje