Technical whitepaper · engineering case study
Distributed Cognition: A Sovereign Agentic AI on a 4 GB Consumer GPU
Uğur Can Leba · system architecture co-developed with an LLM assistant (Claude) · July 2026
Archive / Paper 01. This is a preserved
July 2026 engineering snapshot, kept verbatim as historical record. It is
no longer the canonical ORDIS
paper. The system described here has since gone through V2.0.1–V2.9: a verifiable execution
substrate (Run → Proof → Recovery → Memory → Execution Classes → Skill Lifecycle
→ Workspace → Gateway) was built on top of it. Read the current paper at
ORDIS Agentic Plane —
Accountable Autonomy. This document is unmodified below this notice.
Scientific-integrity note. This document reports an engineered system and its
verifiable properties. It contains no fabricated benchmarks or accuracy figures. Every quantitative
claim is either read directly from the live system (ollama /api/ps, nvidia-smi,
ollama show, the tool registry) or explicitly marked as a methodology rather than a result.
Where rigorous measurement is absent, we say so.
Abstract
We present ORDIS, a sovereign, API-independent AI assistant and agent that
runs on a single consumer laptop (NVIDIA RTX 3050 Laptop, 4 GB VRAM; i5-11400H; 30 GB RAM).
Rather than scaling parameters in one model, ORDIS treats capability as an emergent property of a
system: a single local core (4-bit, GPU-layer-offloaded) handles interactive language and control; a
registry of real tools, retrieval-augmented memory, and a difficulty-aware router supply everything the core
cannot compute itself; and an optional external expert is consulted only for the heaviest
architecture/verification problems the interactive loop never depends on. We report measured
inference throughput on the deployment hardware, a reproducible meaning-fidelity evaluation
(deterministic rule-flags + a temperature-0 LLM judge), and a live, publicly testable product
built on the same stack. We are explicit about structural limits — including a prior tiered ("deep-think tank")
design that was measured, deployed, and later removed after live telemetry showed it caused GPU
contention that degraded the interactive loop (§8). This is a systems demonstration with real measurements,
not a benchmark-beating claim.
Keywords — edge AI · on-device inference · LLM agents ·
tool use · retrieval-augmented generation · quantization · data sovereignty · self-improving systems.
1Introduction
Capable agentic assistants are typically delivered by very large (70B–405B+) models hosted in the cloud.
This imposes three costs: infrastructure and energy overhead, data egress
(user data leaves the device), and recurring per-token billing. For a large class of
personal and small-business tasks, these costs are disproportionate.
We ask a different question: how much useful, honest autonomy is achievable on fixed, modest, offline
hardware if capability is not forced entirely into one model's weights? ORDIS is our answer — an
existence proof that a single locally-served model, anchored by real tools, memory, and disciplined routing,
can drive a genuinely useful agentic system whose design decisions can be measured rather than
asserted — including the decision to remove a tier that measurement showed was not earning its cost.
Contributions
- A concrete distributed-cognition architecture for sovereign edge AI, and its measured operating envelope on 4 GB.
- A self-extension pipeline gated by anti-theater verification — synthesized tools must survive syntax, sandbox, and a placeholder / fake-success rejection filter before registration.
- Grounded self-perception — a runtime-telemetry path that lets a small model answer questions about its own architecture and load without fabricating specifications.
- A human-in-the-loop co-development methodology (“professor–apprentice”) in which an LLM architect and a human operator iteratively strip non-functional (“theater”) subsystems — and roll back architectural tiers that live telemetry proves are net-negative (§8).
2Background & Motivation
The deployment target is a single Ubuntu 26.04 workstation with an RTX 3050 Laptop GPU
(4 GB VRAM). The design constraint is absolute: the system must remain useful offline,
with no external inference API, and with no user data leaving the machine.
Naively, a 4 GB budget suggests models beyond ~4B parameters are ruled out at 4-bit quantization. In
practice, partial GPU-layer offload (§5) lets a larger model run with only a fraction of its layers
GPU-resident and the remainder on CPU/RAM — trading throughput for capacity. The engineering problem is
therefore not “which giant model,” but “how to allocate 4 GB, and how much throughput to trade for
capability.”
3Architecture: Distributed Cognition
Capability is composed, not monolithic — one core model plus tools, memory, and a router:
Core. A single locally-served ~12B instruct model, 4-bit, with a deliberately tuned fraction
of its layers offloaded to the GPU (§5) — the rest run on CPU/RAM. Handles dialogue, intent, and control.
It does not compute what it can delegate; arithmetic, retrieval, I/O and code execution are pushed to
tools.
External expert (heaviest only, optional). For very large refactors or from-scratch
architecture, the router may consult an external frontier model when one is configured — the single deliberate
concession to non-sovereignty, gated to the heaviest tasks; the interactive loop never depends on it, and
honestly reports when none is available rather than degrading silently.
Tools & memory. A live registry of executable capabilities (filesystem, shell, browser
control, web crawl, PDF, OSINT, finance, content generation) returns ground truth; a vector store on CPU/disk
holds long-term memory so persistence does not consume scarce VRAM or context.
Difficulty-aware router. Each request is graded: trivial → core answers directly; very-hard
architecture/refactor → external expert when available; action-requiring → agent loop. Chat stays responsive
because the core never blocks waiting on a network call.
4Key Mechanisms
4.1 · Self-extension with an anti-theater verification gate
The system can synthesize new tools from a natural-language capability description. Generated code passes
through (i) syntax validation, (ii) sandbox execution, and (iii) an
anti-theater gate that rejects code exhibiting simulated success — placeholder
markers, or a hard-coded “completed successfully” return with no real I/O, network, or computation. Only code
surviving all three is registered. The gate exists because sandbox-callability alone is insufficient: a stub
that returns a success string is callable yet useless.
4.2 · Grounded self-perception (anti-hallucination)
Small models asked to describe their own infrastructure tend to confabulate plausible-but-false
stacks (e.g., inventing an unrelated framework or dependency). ORDIS instead answers such questions from
live telemetry — querying its inference server, GPU, error log, and tool registry — and
defaults to “I need to check my logs” under uncertainty. This converts a generative task (prone to
hallucination) into a retrieval task over ground truth.
4.3 · Professor–apprentice co-development
Development proceeds as an iterative loop: an LLM architect proposes and audits; the human operator directs
and adjudicates; non-functional subsystems (“theater”) are detected and either converted to real
implementations or removed on a recurring cadence. This is a methodology claim, not a performance claim.
5Implementation OBSERVED IN REPOSITORY
| Core model | ~12B instruct (Gemma family), 4-bit — stock instruct weights carrying a persona/tool-orchestration system prompt. No merged fine-tune is deployed at time of writing; a dataset-tuned (LoRA) bake is in the pipeline but has not yet been run against this model — we state this rather than imply it is already trained. |
| External expert | frontier model, consulted only for the heaviest refactor/architecture, when configured (never required by the interactive loop) |
| Inference engine | llama.cpp / ollama, GGUF Q4_K_M, GPU layer-offload (compiled for CUDA cc 8.6) |
| Hardware | RTX 3050 Laptop — 4096 MiB VRAM · i5-11400H · 30 GB RAM |
| Core at load | 18 of 48 layers GPU-resident (~3.4 GB VRAM), remainder CPU/RAM |
| Embeddings | nomic-embed-text, CPU-pinned (0 VRAM) |
| Vector store | ChromaDB (CPU / disk) |
| Tool registry | Runtime-populated registry. A July 2026 snapshot reported 264 entries; the current count is not exposed as live telemetry. |
| Host | Ubuntu 26.04 LTS · Docker |
6Measured Inference Throughput ✓ MEASURED ON THIS MACHINE
Single-stream generation, measured live against the deployed ollama endpoint on the deployment
hardware, with 18 of 48 transformer layers offloaded to the 4 GB GPU (the rest run on CPU/RAM — VRAM is
the binding constraint).
| ~12B, 18/48 layers GPU-resident | 5–8 tok/s, two back-to-back live samples: 4.9 and 5.9 tok/s under concurrent background load; up to ~8.5 tok/s measured previously with the GPU otherwise idle |
Finding. Throughput on this box is dominated by contention, not just layer-count:
the same model/offload configuration swings roughly ±40% depending on what else the system is doing on the
single GPU at that instant. This is the direct, measured consequence of the tiering failure described in §8 —
it is also why the earlier 4-tier throughput comparison (4B/8B/14B/32B, superseded by this migration) is not
reproduced here as a like-for-like number: those figures described a model family and offload ladder that is
no longer deployed. We report what is currently live rather than retain a comparison that would be
accurate history but a misleading present-tense claim.
7Evaluation
Feasibility. The full stack (interactive ~12B core + runtime tool registry + RAG +
self-diagnostics) runs within 4 GB VRAM / 30 GB RAM, offline for the core loop.
Cost / sovereignty. $0 marginal inference cost for the core; no data egress from the local
core loop. The essential agent loop remains operational without the optional external-expert escalation path.
Meaning-fidelity harness (reproducible). Persona and loss curves miss semantic
drift — a model can be fluent yet misread. We score responses to a held-out set of adversarial prompts
(idioms, polysemy, negation-scope, referent tracking) with two layers: a deterministic rule-flag
layer (formality leaks, calque, theater, identity confusion) and an impartial LLM judge at temperature 0
scoring meaning-fidelity and fluency 0–5. Because judge and prompts are fixed, iterations are directly
comparable. Historical baseline (prior 4B-family model, now superseded): mean meaning-fidelity
1.5/5, fluency 2.68/5, 0 rule-flags — surface-clean but semantically weak, exactly the
failure the harness exposes. The harness has not yet been re-run end-to-end against the current ~12B
core; we report this gap explicitly rather than imply a re-measurement that has not happened. The harness
ships with the system precisely so each future iteration is directly comparable to this baseline.
A falsifiable, live artifact. The same sovereign stack hosts a live public micro-service —
an offline secret/PII scanner — at gaia-api.soundbygaia.com. A reader can POST /scan
a snippet and receive structured findings, verifying that the described stack produces a real, running
product. Part of this paper is testable by anyone, right now.
8Limitations (stated plainly)
- Reasoning depth of the core. A ~12B model at 4-bit cannot match frontier (70B–405B) zero-shot abstract reasoning; hard problems are routed to an external expert when one is configured — otherwise the system says so rather than guessing, and stays local (seconds-to-minutes when it does escalate).
- Non-sovereign escape hatch. The heaviest-task path may consult an external model — a deliberate, bounded concession, not used by the interactive loop.
- Semantic ceiling. The ~12B core still misses some polysemy/idiom traps; the meaning harness treats this as a first-class, tracked target rather than a footnote — though the current core has not yet been re-scored on it (§7).
- Tiering is not automatically a win. A prior second-model “deep-think tank” tier was built, measured, and later removed: it was correct in isolation but competed for the same single GPU as the interactive core in production, degrading real chat latency during ordinary use. We keep this in the paper as a documented negative result, not a footnote to omit.
- Single hardware / single operator. Throughput numbers are specific to this box and not yet reproduced across configurations.
- No external leaderboard yet. Claims concern measured system properties and relative iteration, not comparative accuracy against published models.
9Discussion & Future Work
Under hard resource and sovereignty constraints, architecture and measured model-selection can
substitute for raw parameters across a meaningful band of tasks — but only when each added layer of
architecture is itself held to the same measurement standard as the base system; tiering that is not verified
under real, concurrent production load can quietly cost more than it returns. Future work: (1) a
reproducible tool-success and task-completion harness; (2) cross-hardware reproduction of the throughput
numbers; (3) re-running the meaning-fidelity harness against the current core and publishing the full
score history across iterations; (4) formalizing the anti-theater gate and model-agnostic self-perception
as reusable components.
10Conclusion
ORDIS is an engineered demonstration that useful, sovereign, self-extending agentic AI is achievable on a
4 GB consumer laptop — provided intelligence is treated as a property of a system (model, tools,
memory, routing), model and architecture choices are measured against the hardware rather
than assumed, and the system is held to an honesty standard: every capability maps to something real,
self-reports come from measurement, architecture that measurement disproves gets removed rather than kept for
appearances, and part of the result is publicly falsifiable.
References
- Google DeepMind. Gemma technical report family. (base model)
- Hu et al. LoRA: Low-Rank Adaptation of Large Language Models. 2021. (planned fine-tune method, not yet applied — §5)
- Gerganov et al. llama.cpp / GGUF — efficient LLM inference and k-quant quantization.
- Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models. 2023.
- Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. 2020.
- ChromaDB — open-source embedding database.
Teknik whitepaper · mühendislik vaka çalışması
Dağıtık Biliş: 4 GB'lık Tüketici GPU'sunda Egemen Bir Ajan-Yapay Zekâ
Uğur Can Leba · sistem mimarisi bir LLM asistanıyla (Claude) birlikte geliştirildi · Temmuz 2026
Arşiv / Makale 01. Bu, Temmuz 2026
tarihli bir mühendislik anlık görüntüsüdür ve tarihsel kayıt olarak olduğu gibi korunmaktadır. Artık
kanonik ORDIS makalesi değildir. Burada anlatılan sistem o tarihten sonra V2.0.1–V2.9'dan geçti:
üzerine doğrulanabilir bir yürütme alt-yapısı (Run → Proof → Recovery → Memory →
Execution Classes → Skill Lifecycle → Workspace → Gateway) kuruldu. Güncel makaleyi
ORDIS Agentic Plane —
Hesap Verebilir Özerklik sayfasında okuyun. Bu belge, bu notun altında değiştirilmemiştir.
Bilimsel dürüstlük notu. Bu belge, mühendislikle kurulmuş bir sistemi ve onun
doğrulanabilir özelliklerini raporlar. Uydurma benchmark ya da doğruluk rakamı içermez. Her
nicel iddia ya doğrudan canlı sistemden okunmuştur (ollama /api/ps, nvidia-smi,
ollama show, araç kaydı) ya da bir sonuç değil bir metodoloji olarak açıkça
işaretlenmiştir. Titiz ölçümün olmadığı yerde bunu belirtiriz.
Özet
ORDIS'i sunuyoruz: tek bir tüketici dizüstünde (NVIDIA RTX 3050
Laptop, 4 GB VRAM; i5-11400H; 30 GB RAM) çalışan, egemen ve API'den bağımsız bir yapay zekâ
asistanı/ajanı. ORDIS, tek modelde parametre büyütmek yerine yeteneği bir sistemin ortaya çıkan
özelliği olarak ele alır: tek, 4-bit, GPU-katman-offload'lı bir yerel çekirdek etkileşimli dili ve
kontrolü üstlenir; çekirdeğin hesaplayamadığı her şeyi gerçek bir araç kaydı, geri-getirmeli bellek ve
zorluk-farkında bir yönlendirici karşılar; ve yalnızca en ağır mimari/doğrulama işleri için, etkileşim
döngüsünün asla bağımlı olmadığı isteğe bağlı bir harici uzmana danışılır. Dağıtım donanımında
ölçülmüş çıkarım hızını, tekrarlanabilir bir anlam-sadakati değerlendirmesini
(deterministik kural-bayrakları + sıcaklık-0 bir LLM yargıç) ve aynı yığın üzerine kurulu canlı,
herkesçe test-edilebilir bir ürünü raporluyoruz. Yapısal sınırları — canlı telemetrinin etkileşimli
döngüyle GPU çekişmesine girdiğini gösterdiği, ölçülüp devreye alınıp SONRA kaldırılan eski bir
katmanlı ("düşünce tankı") tasarım dahil (§8) — açıkça belirtiyoruz. Bu, gerçek ölçümlü bir sistem gösterimidir;
benchmark yenen bir iddia değil.
Anahtar kelimeler — uç yapay zekâ · cihaz-üstü çıkarım ·
LLM ajanları · araç kullanımı · geri-getirmeli üretim · kuantizasyon · veri egemenliği · kendini-geliştiren sistemler.
1Giriş
Yetenekli ajan asistanlar tipik olarak bulutta barındırılan çok büyük (70B–405B+) modellerle sunulur. Bu üç
maliyet getirir: altyapı ve enerji yükü, veri dışa-akışı (kullanıcı verisi
cihazı terk eder) ve sürekli token-başı faturalandırma. Kişisel ve küçük-işletme
görevlerinin büyük bir bölümü için bu maliyetler orantısızdır.
Biz farklı bir soru soruyoruz: tüm yeteneği tek modelin ağırlıklarına yüklemezsek, sabit, mütevazı ve
çevrimdışı bir donanımda ne kadar işe yarar, dürüst otonomi elde edilebilir? ORDIS bunun cevabı —
yerelde sunulan TEK bir modelin; gerçek araçlar, bellek ve disiplinli yönlendirmeyle eşleştiğinde gerçekten
işe yarar bir ajan sistemine çıpa olabildiğinin, üstelik tasarım kararlarının (mimariden vazgeçme
kararı dahil) iddia değil ölçümle gösterilebildiğinin bir varlık kanıtı.
Katkılar
- Egemen uç yapay zekâ için somut bir dağıtık-biliş mimarisi ve onun 4 GB'da ölçülmüş çalışma zarfı.
- Anti-tiyatro doğrulama kapılı bir kendini-genişletme hattı — üretilen araçlar kayıttan önce sözdizimi, sandbox ve placeholder/sahte-başarı reddi filtresini geçmek zorundadır.
- Grounded öz-algı — küçük bir modelin kendi mimarisi ve yükü hakkındaki soruları uydurmadan yanıtlamasını sağlayan bir canlı-telemetri yolu.
- Bir LLM mimarı ile insan operatörün işlevsiz (“tiyatro”) alt-sistemleri döngüsel olarak ayıkladığı — VE canlı telemetrinin net-negatif olduğunu kanıtladığı mimari katmanları geri aldığı (§8) — insan-döngüde bir birlikte-geliştirme metodolojisi (“profesör–çırak”).
2Arka Plan ve Motivasyon
Dağıtım hedefi, RTX 3050 Laptop GPU (4 GB VRAM) bulunan tek bir Ubuntu 26.04 iş
istasyonudur. Tasarım kısıtı kesindir: sistem çevrimdışı, dış çıkarım API'si
olmadan ve hiçbir kullanıcı verisi makineyi terk etmeden işe yarar kalmalıdır.
Naif bakışta 4 GB bütçe, 4-bit kuantizasyonda ~4B parametrenin ötesindeki modelleri eler gibi görünür.
Pratikte kısmi GPU-katman offload (§5), bir modelin katmanlarının yalnızca bir kısmını GPU'da tutup gerisini
CPU/RAM'de çalıştırarak daha büyük bir modelin çalışmasına izin verir — hız karşılığında kapasite kazanılır.
Mühendislik problemi bu yüzden “hangi dev model” değil, “4 GB nasıl paylaştırılır, ne kadar hız
kapasiteye feda edilir”dır.
3Mimari: Dağıtık Biliş
Yetenek tekil değil, bileşiktir — tek bir çekirdek model artı araçlar, bellek ve bir yönlendirici:
Çekirdek. Yerelde sunulan tek bir ~12B'lik instruct model, 4-bit; katmanlarının bilinçli
ayarlanmış bir kısmı GPU'ya kaydırılır (§5), gerisi CPU/RAM'de çalışır. Diyalog, niyet ve kontrolü üstlenir.
Devredebileceğini hesaplamaz; aritmetik, geri-getirme, girdi/çıktı ve kod çalıştırma araçlara itilir.
Harici uzman (yalnız en ağır, isteğe bağlı). Çok büyük refactor ya da sıfırdan mimari için
yönlendirici, yapılandırılmışsa harici bir sınır-model modeline danışabilir — egemenlikten tek kasıtlı taviz,
en ağır işlere kapılı; etkileşim döngüsü buna asla bağımlı değildir ve hiçbiri yapılandırılmamışsa sessizce
bozulmak yerine bunu dürüstçe bildirir.
Araçlar ve bellek. Çalıştırılabilir yeteneklerden canlı bir kayıt (dosya sistemi, kabuk,
tarayıcı kontrolü, web tarama, PDF, OSINT, finans, içerik üretimi) zemin-gerçeği döndürür; CPU/disk'teki bir
vektör deposu uzun-vadeli belleği tutar, böylece kalıcılık kıt VRAM'i ya da bağlamı tüketmez.
Zorluk-farkında yönlendirici. Her istek derecelendirilir: önemsiz → çekirdek doğrudan
cevaplar; çok-zor mimari/refactor → yapılandırılmışsa harici uzman; aksiyon-gerektiren → ajan döngüsü. Sohbet
akıcı kalır çünkü çekirdek hiçbir zaman bir ağ çağrısını bekleyerek bloklanmaz.
4Temel Mekanizmalar
4.1 · Anti-tiyatro doğrulama kapılı kendini-genişletme
Sistem, doğal dildeki bir yetenek tarifinden yeni araçlar sentezleyebilir. Üretilen kod şu aşamalardan
geçer: (i) sözdizimi doğrulama, (ii) sandbox çalıştırma ve (iii) gerçek
girdi/çıktı, ağ veya hesaplama olmadan placeholder işaretleri ya da sabit “başarıyla tamamlandı” dönüşü gibi
taklit-başarı sergileyen kodu reddeden bir anti-tiyatro kapısı. Yalnızca üçünü de
geçen kod kaydedilir. Bu kapı vardır çünkü sandbox'ta çağrılabilir olmak tek başına yetmez: başarı string'i
döndüren bir stub çağrılabilir ama işe yaramazdır.
4.2 · Grounded öz-algı (anti-halüsinasyon)
Kendi altyapısını anlatması istenen küçük modeller, akla yatkın ama yanlış yığınlar uydurmaya
eğilimlidir (örneğin ilgisiz bir çatı ya da bağımlılık icat etmek). ORDIS bunun yerine bu tür soruları
canlı telemetriden yanıtlar — çıkarım sunucusunu, GPU'yu, hata logunu ve araç kaydını
sorgular — ve belirsizlikte varsayılan olarak “loglarıma bakmam lazım” der. Bu, üretici bir görevi
(halüsinasyona yatkın) zemin-gerçek üzerinde bir geri-getirme görevine dönüştürür.
4.3 · Profesör–çırak birlikte-geliştirme
Geliştirme döngüsel ilerler: bir LLM mimarı önerir ve denetler; insan operatör yönlendirir ve karar verir;
işlevsiz alt-sistemler (“tiyatro”) tespit edilip ya gerçek implementasyona çevrilir ya da düzenli aralıklarla
kaldırılır. Bu bir metodoloji iddiasıdır, bir performans iddiası değil.
5Uygulama REPO'DA GÖZLENDİ
| Çekirdek model | ~12B instruct (Gemma ailesi), 4-bit — stok instruct ağırlıkları üzerine persona/araç-orkestrasyon sistem promptu bindirilmiş. Yazım anında gömülü bir ince-ayar YOK; veri-setiyle-ayarlanmış (LoRA) bir "bake" boru hattı planda ama bu modele henüz uygulanmadı — çoktan eğitilmiş gibi ima etmek yerine bunu açıkça belirtiyoruz. |
| Harici uzman | sınır-model; yalnız en ağır refactor/mimari için, yapılandırılmışsa (etkileşim döngüsü asla gerektirmez) |
| Çıkarım motoru | llama.cpp / ollama, GGUF Q4_K_M, GPU katman-offload (CUDA cc 8.6 için derlendi) |
| Donanım | RTX 3050 Laptop — 4096 MiB VRAM · i5-11400H · 30 GB RAM |
| Yükte çekirdek | 48 katmanın 18'i GPU'da (~3.4 GB VRAM), gerisi CPU/RAM |
| Embedding | nomic-embed-text, CPU'ya pinli (0 VRAM) |
| Vektör deposu | ChromaDB (CPU / disk) |
| Araç kaydı | Çalışma zamanında doldurulan kayıt. Temmuz 2026 anlık görüntüsü 264 giriş raporladı; güncel sayı canlı telemetri gibi sunulmaz. |
| Ana sistem | Ubuntu 26.04 LTS · Docker |
6Ölçülmüş Çıkarım Hızı ✓ BU MAKİNEDE ÖLÇÜLDÜ
Tek-akış üretim, dağıtım donanımındaki canlı ollama uç noktasına karşı ölçüldü; 48 transformer
katmanının 18'i 4 GB GPU'ya kaydırılmış durumda (gerisi CPU/RAM'de — VRAM bağlayıcı kısıt).
| ~12B, 48 katmanın 18'i GPU'da | 5–8 tok/sn, art arda iki canlı örnek: eşzamanlı arka-plan yükü altında 4.9 ve 5.9 tok/sn; GPU'nun başka türlü boşta olduğu önceki ölçümlerde ~8.5 tok/sn'ye kadar |
Bulgu. Bu kutuda hız, yalnızca katman-sayısından değil büyük ölçüde çekişmeden
belirleniyor: aynı model/offload yapılandırması, o an tek GPU'da başka ne çalıştığına bağlı olarak
kabaca ±%40 salınıyor. Bu, §8'de anlatılan katmanlama-başarısızlığının doğrudan, ölçülmüş sonucudur — aynı
zamanda önceki 4-katmanlı hız kıyaslamasının (4B/8B/14B/32B, bu geçişle geçersiz kılındı) burada birebir bir
rakam olarak tekrarlanmamasının nedenidir: o rakamlar artık dağıtılmayan bir model ailesini ve offload
merdivenini anlatıyordu. Doğru bir tarih olup yanıltıcı bir şimdiki-zaman iddiası olacak bir kıyaslamayı
korumak yerine, şu an canlı olanı raporluyoruz.
7Değerlendirme
Yapılabilirlik. Tam yığın (etkileşimli ~12B çekirdek + çalışma-zamanı araç kaydı + RAG + öz-teşhis)
4 GB VRAM / 30 GB RAM içinde, çekirdek döngüsü çevrimdışı çalışır.
Maliyet / egemenlik. Çekirdek için $0 marjinal çıkarım maliyeti; yerel çekirdek döngüsünden
veri dışa-akışı yoktur. Temel ajan döngüsü, isteğe bağlı dış-uzman yükseltme yolu olmadan da çalışmayı sürdürür.
Anlam-sadakati harness'ı (tekrarlanabilir). Persona ve loss eğrileri anlam
kaymasını yakalamaz — bir model akıcı olup yine de yanlış okuyabilir. Held-out zorlayıcı promptlara
(deyim, çok-anlamlılık, olumsuzluk-kapsamı, gönderim takibi) verilen cevapları iki katmanla puanlarız:
deterministik bir kural-bayrak katmanı (formalite sızıntısı, calque, tiyatro, kimlik karışması) ve
sıcaklık-0 tarafsız bir LLM yargıç (anlam-sadakati + akıcılık 0–5). Yargıç ve promptlar sabit olduğu
için sürümler doğrudan kıyaslanabilir. Tarihsel baseline (artık geçersiz kılınan önceki 4B-ailesi
model): ortalama anlam-sadakati 1.5/5, akıcılık 2.68/5, 0 kural-bayrağı — yüzeyde temiz
ama anlamda zayıf; tam da harness'ın açığa çıkardığı hata. Harness, güncel ~12B çekirdeğe karşı henüz
uçtan-uca yeniden çalıştırılmadı; gerçekleşmemiş bir yeniden-ölçümü ima etmek yerine bu boşluğu açıkça
raporluyoruz. Harness sistemle birlikte gelir, tam da her gelecek sürümün bu baseline'a doğrudan kıyaslanabilmesi için.
Çürütülebilir, canlı bir artefakt. Aynı egemen yığın canlı bir public micro-servisi
barındırır — offline bir secret/PII tarayıcı — gaia-api.soundbygaia.com adresinde. Bir okuyucu
POST /scan ile bir kod parçası gönderip yapısal bulgular alabilir; böylece anlatılan yığının
gerçek, çalışan bir ürün ürettiğini doğrular. Bu makalenin bir parçası şu an herkesçe test edilebilir.
8Sınırlar (açıkça)
- Çekirdeğin muhakeme derinliği. 4-bit bir ~12B model, frontier (70B–405B) sıfır-atış soyut muhakemesine erişemez; zor problemler yapılandırılmışsa harici uzmana yönlendirilir — değilse sistem tahmin yürütmek yerine bunu söyler ve yerelde kalır (yönlendiğinde saniyeler-dakikalar sürer).
- Egemenlik kaçış-kapısı. En ağır iş yolu harici bir modele danışabilir — kasıtlı, sınırlı bir taviz; etkileşim döngüsünde kullanılmaz.
- Anlam tavanı. ~12B çekirdek bile bazı çok-anlamlılık/deyim tuzaklarını kaçırır; anlam harness'ı bunu dipnot değil izlenen birincil hedef olarak ele alır — ancak güncel çekirdek bu harness'ta henüz yeniden puanlanmadı (§7).
- Katmanlama otomatik bir kazanç değildir. İkinci-model bir "düşünce tankı" katmanı kuruldu, ölçüldü ve sonra kaldırıldı: tek başına doğruydu ama üretimde etkileşimli çekirdekle AYNI tek GPU için rekabet ederek olağan kullanımda gerçek sohbet gecikmesini kötüleştirdi. Bunu bir dipnot olarak atlamak yerine belgelenmiş bir negatif sonuç olarak makalede tutuyoruz.
- Tek donanım / tek operatör. Hız rakamları bu kutuya özgüdür, henüz farklı yapılandırmalarda yeniden üretilmedi.
- Henüz harici leaderboard yok. İddialar ölçülen sistem özellikleri ve görece yineleme hakkındadır, yayımlanmış modellere karşı karşılaştırmalı doğruluk değil.
9Tartışma ve Gelecek Çalışma
Katı kaynak ve egemenlik kısıtları altında, anlamlı bir görev bandında mimari ve ölçülmüş
model-seçimi ham parametrenin yerine geçebilir — ama yalnızca eklenen her mimari katman, temel
sisteminkiyle AYNI ölçüm standardına tutulduğunda; gerçek eşzamanlı üretim yükü altında doğrulanmamış
katmanlama, sessizce getirdiğinden fazlasına mal olabilir. Gelecek çalışma: (1) sabit ajan döngüsünde
yeniden-üretilebilir araç-başarı ve görev-tamamlama koşum-ortamı; (2) hız rakamlarının donanımlar-arası
yeniden üretimi; (3) anlam-sadakati harness'ını güncel çekirdeğe karşı yeniden çalıştırıp tam
sürümler-arası skor geçmişini yayımlama; (4) anti-tiyatro kapısı ile model-agnostik öz-algıyı
yeniden-kullanılabilir bileşenler olarak formelleştirme.
10Sonuç
ORDIS; işe yarar, egemen ve kendini-genişleten bir ajan-yapay zekânın 4 GB'lık bir tüketici dizüstünde
elde edilebileceğinin mühendislikle kurulmuş bir gösterimidir — yeter ki zekâ (model, araçlar, bellek,
yönlendirme) bir sistemin özelliği olarak ele alınsın, model ve mimari kararları varsayımla değil
ölçümle yapılsın ve sistem bir dürüstlük standardına tutulsun: her yetenek gerçek bir şeye
karşılık gelir, öz-raporlar ölçümden gelir, ölçümün yanlışladığı mimari görüntü için tutulmak yerine kaldırılır,
ve sonucun bir kısmı herkesçe çürütülebilirdir.
Kaynaklar
- Google DeepMind. Gemma teknik rapor ailesi. (temel model)
- Hu vd. LoRA: Low-Rank Adaptation of Large Language Models. 2021. (planlanan ince-ayar yöntemi, henüz uygulanmadı — §5)
- Gerganov vd. llama.cpp / GGUF — verimli LLM çıkarımı ve k-quant kuantizasyon.
- Yao vd. ReAct: Synergizing Reasoning and Acting in Language Models. 2023.
- Lewis vd. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. 2020.
- ChromaDB — açık kaynak embedding veritabanı.