Technical whitepaper · engineering case study

Distributed Cognition: A Sovereign Agentic AI on a 4 GB Consumer GPU

Uğur Can Leba · system architecture co-developed with an LLM assistant (Claude) · July 2026
Scientific-integrity note. This document reports an engineered system and its verifiable properties. It contains no fabricated benchmarks or accuracy figures. Every quantitative claim is either read directly from the live system (ollama /api/ps, nvidia-smi, ollama show, the tool registry) or explicitly marked as a methodology rather than a result. Where rigorous measurement is absent, we say so.

Abstract

We present ORDIS, a sovereign, API-independent AI assistant and agent that runs on a single consumer laptop (NVIDIA RTX 3050 Laptop, 4 GB VRAM; i5-11400H; 30 GB RAM). Rather than scaling parameters in one model, ORDIS treats capability as an emergent property of a system: a single local core (4-bit, GPU-layer-offloaded) handles interactive language and control; a registry of real tools, retrieval-augmented memory, and a difficulty-aware router supply everything the core cannot compute itself; and an optional external expert is consulted only for the heaviest architecture/verification problems the interactive loop never depends on. We report measured inference throughput on the deployment hardware, a reproducible meaning-fidelity evaluation (deterministic rule-flags + a temperature-0 LLM judge), and a live, publicly testable product built on the same stack. We are explicit about structural limits — including a prior tiered ("deep-think tank") design that was measured, deployed, and later removed after live telemetry showed it caused GPU contention that degraded the interactive loop (§8). This is a systems demonstration with real measurements, not a benchmark-beating claim.

Keywords — edge AI · on-device inference · LLM agents · tool use · retrieval-augmented generation · quantization · data sovereignty · self-improving systems.

1Introduction

Capable agentic assistants are typically delivered by very large (70B–405B+) models hosted in the cloud. This imposes three costs: infrastructure and energy overhead, data egress (user data leaves the device), and recurring per-token billing. For a large class of personal and small-business tasks, these costs are disproportionate.

We ask a different question: how much useful, honest autonomy is achievable on fixed, modest, offline hardware if capability is not forced entirely into one model's weights? ORDIS is our answer — an existence proof that a single locally-served model, anchored by real tools, memory, and disciplined routing, can drive a genuinely useful agentic system whose design decisions can be measured rather than asserted — including the decision to remove a tier that measurement showed was not earning its cost.

Contributions

  1. A concrete distributed-cognition architecture for sovereign edge AI, and its measured operating envelope on 4 GB.
  2. A self-extension pipeline gated by anti-theater verification — synthesized tools must survive syntax, sandbox, and a placeholder / fake-success rejection filter before registration.
  3. Grounded self-perception — a runtime-telemetry path that lets a small model answer questions about its own architecture and load without fabricating specifications.
  4. A human-in-the-loop co-development methodology (“professor–apprentice”) in which an LLM architect and a human operator iteratively strip non-functional (“theater”) subsystems — and roll back architectural tiers that live telemetry proves are net-negative (§8).

2Background & Motivation

The deployment target is a single Ubuntu 26.04 workstation with an RTX 3050 Laptop GPU (4 GB VRAM). The design constraint is absolute: the system must remain useful offline, with no external inference API, and with no user data leaving the machine. Naively, a 4 GB budget suggests models beyond ~4B parameters are ruled out at 4-bit quantization. In practice, partial GPU-layer offload (§5) lets a larger model run with only a fraction of its layers GPU-resident and the remainder on CPU/RAM — trading throughput for capacity. The engineering problem is therefore not “which giant model,” but “how to allocate 4 GB, and how much throughput to trade for capability.”

3Architecture: Distributed Cognition

Capability is composed, not monolithic — one core model plus tools, memory, and a router:

Core. A single locally-served ~12B instruct model, 4-bit, with a deliberately tuned fraction of its layers offloaded to the GPU (§5) — the rest run on CPU/RAM. Handles dialogue, intent, and control. It does not compute what it can delegate; arithmetic, retrieval, I/O and code execution are pushed to tools.

External expert (heaviest only, optional). For very large refactors or from-scratch architecture, the router may consult an external frontier model when one is configured — the single deliberate concession to non-sovereignty, gated to the heaviest tasks; the interactive loop never depends on it, and honestly reports when none is available rather than degrading silently.

Tools & memory. A live registry of executable capabilities (filesystem, shell, browser control, web crawl, PDF, OSINT, finance, content generation) returns ground truth; a vector store on CPU/disk holds long-term memory so persistence does not consume scarce VRAM or context.

Difficulty-aware router. Each request is graded: trivial → core answers directly; very-hard architecture/refactor → external expert when available; action-requiring → agent loop. Chat stays responsive because the core never blocks waiting on a network call.

An earlier iteration of this architecture also ran a second, heavier local model (a “deep-think tank”, ~14B, invoked asynchronously) as an intermediate tier between the core and the external expert. It was measured, deployed, and later removed — not because the idea was wrong in principle, but because live production telemetry showed it competing for the same single GPU with the interactive core, degrading real chat latency during ordinary use. See §8 for the measured failure mode. We report this because a negative, measured result is still a result.

4Key Mechanisms

4.1 · Self-extension with an anti-theater verification gate

The system can synthesize new tools from a natural-language capability description. Generated code passes through (i) syntax validation, (ii) sandbox execution, and (iii) an anti-theater gate that rejects code exhibiting simulated success — placeholder markers, or a hard-coded “completed successfully” return with no real I/O, network, or computation. Only code surviving all three is registered. The gate exists because sandbox-callability alone is insufficient: a stub that returns a success string is callable yet useless.

4.2 · Grounded self-perception (anti-hallucination)

Small models asked to describe their own infrastructure tend to confabulate plausible-but-false stacks (e.g., inventing an unrelated framework or dependency). ORDIS instead answers such questions from live telemetry — querying its inference server, GPU, error log, and tool registry — and defaults to “I need to check my logs” under uncertainty. This converts a generative task (prone to hallucination) into a retrieval task over ground truth.

4.3 · Professor–apprentice co-development

Development proceeds as an iterative loop: an LLM architect proposes and audits; the human operator directs and adjudicates; non-functional subsystems (“theater”) are detected and either converted to real implementations or removed on a recurring cadence. This is a methodology claim, not a performance claim.

5Implementation ✓ VERIFIED LIVE

Core model~12B instruct (Gemma family), 4-bit — stock instruct weights carrying a persona/tool-orchestration system prompt. No merged fine-tune is deployed at time of writing; a dataset-tuned (LoRA) bake is in the pipeline but has not yet been run against this model — we state this rather than imply it is already trained.
External expertfrontier model, consulted only for the heaviest refactor/architecture, when configured (never required by the interactive loop)
Inference enginellama.cpp / ollama, GGUF Q4_K_M, GPU layer-offload (compiled for CUDA cc 8.6)
HardwareRTX 3050 Laptop — 4096 MiB VRAM · i5-11400H · 30 GB RAM
Core at load18 of 48 layers GPU-resident (~3.4 GB VRAM), remainder CPU/RAM
Embeddingsnomic-embed-text, CPU-pinned (0 VRAM)
Vector storeChromaDB (CPU / disk)
Tool registry264 registered tools (live count)
HostUbuntu 26.04 LTS · Docker

6Measured Inference Throughput ✓ MEASURED ON THIS MACHINE

Single-stream generation, measured live against the deployed ollama endpoint on the deployment hardware, with 18 of 48 transformer layers offloaded to the 4 GB GPU (the rest run on CPU/RAM — VRAM is the binding constraint).

~12B, 18/48 layers GPU-resident5–8 tok/s, two back-to-back live samples: 4.9 and 5.9 tok/s under concurrent background load; up to ~8.5 tok/s measured previously with the GPU otherwise idle

Finding. Throughput on this box is dominated by contention, not just layer-count: the same model/offload configuration swings roughly ±40% depending on what else the system is doing on the single GPU at that instant. This is the direct, measured consequence of the tiering failure described in §8 — it is also why the earlier 4-tier throughput comparison (4B/8B/14B/32B, superseded by this migration) is not reproduced here as a like-for-like number: those figures described a model family and offload ladder that is no longer deployed. We report what is currently live rather than retain a comparison that would be accurate history but a misleading present-tense claim.

7Evaluation

Feasibility. The full stack (interactive ~12B core + 264-tool registry + RAG + self-diagnostics) runs within 4 GB VRAM / 30 GB RAM, offline for the core loop. Cost / sovereignty. $0 marginal inference cost for the core; no data egress; interactive loop 100% offline-capable.

Meaning-fidelity harness (reproducible). Persona and loss curves miss semantic drift — a model can be fluent yet misread. We score responses to a held-out set of adversarial prompts (idioms, polysemy, negation-scope, referent tracking) with two layers: a deterministic rule-flag layer (formality leaks, calque, theater, identity confusion) and an impartial LLM judge at temperature 0 scoring meaning-fidelity and fluency 0–5. Because judge and prompts are fixed, iterations are directly comparable. Historical baseline (prior 4B-family model, now superseded): mean meaning-fidelity 1.5/5, fluency 2.68/5, 0 rule-flags — surface-clean but semantically weak, exactly the failure the harness exposes. The harness has not yet been re-run end-to-end against the current ~12B core; we report this gap explicitly rather than imply a re-measurement that has not happened. The harness ships with the system precisely so each future iteration is directly comparable to this baseline.

A falsifiable, live artifact. The same sovereign stack hosts a live public micro-service — an offline secret/PII scanner — at gaia-api.soundbygaia.com. A reader can POST /scan a snippet and receive structured findings, verifying that the described stack produces a real, running product. Part of this paper is testable by anyone, right now.

8Limitations (stated plainly)

9Discussion & Future Work

Under hard resource and sovereignty constraints, architecture and measured model-selection can substitute for raw parameters across a meaningful band of tasks — but only when each added layer of architecture is itself held to the same measurement standard as the base system; tiering that is not verified under real, concurrent production load can quietly cost more than it returns. Future work: (1) a reproducible tool-success and task-completion harness; (2) cross-hardware reproduction of the throughput numbers; (3) re-running the meaning-fidelity harness against the current core and publishing the full score history across iterations; (4) formalizing the anti-theater gate and model-agnostic self-perception as reusable components.

10Conclusion

ORDIS is an engineered demonstration that useful, sovereign, self-extending agentic AI is achievable on a 4 GB consumer laptop — provided intelligence is treated as a property of a system (model, tools, memory, routing), model and architecture choices are measured against the hardware rather than assumed, and the system is held to an honesty standard: every capability maps to something real, self-reports come from measurement, architecture that measurement disproves gets removed rather than kept for appearances, and part of the result is publicly falsifiable.

References

  1. Google DeepMind. Gemma technical report family. (base model)
  2. Hu et al. LoRA: Low-Rank Adaptation of Large Language Models. 2021. (planned fine-tune method, not yet applied — §5)
  3. Gerganov et al. llama.cpp / GGUF — efficient LLM inference and k-quant quantization.
  4. Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models. 2023.
  5. Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. 2020.
  6. ChromaDB — open-source embedding database.

This whitepaper is written to be falsifiable. The system is open to inspection; its resource ledger, hardware limits, and failure modes are stated so a reader can verify or refute them directly.

Teknik whitepaper · mühendislik vaka çalışması

Dağıtık Biliş: 4 GB'lık Tüketici GPU'sunda Egemen Bir Ajan-Yapay Zekâ

Uğur Can Leba · sistem mimarisi bir LLM asistanıyla (Claude) birlikte geliştirildi · Temmuz 2026
Bilimsel dürüstlük notu. Bu belge, mühendislikle kurulmuş bir sistemi ve onun doğrulanabilir özelliklerini raporlar. Uydurma benchmark ya da doğruluk rakamı içermez. Her nicel iddia ya doğrudan canlı sistemden okunmuştur (ollama /api/ps, nvidia-smi, ollama show, araç kaydı) ya da bir sonuç değil bir metodoloji olarak açıkça işaretlenmiştir. Titiz ölçümün olmadığı yerde bunu belirtiriz.

Özet

ORDIS'i sunuyoruz: tek bir tüketici dizüstünde (NVIDIA RTX 3050 Laptop, 4 GB VRAM; i5-11400H; 30 GB RAM) çalışan, egemen ve API'den bağımsız bir yapay zekâ asistanı/ajanı. ORDIS, tek modelde parametre büyütmek yerine yeteneği bir sistemin ortaya çıkan özelliği olarak ele alır: tek, 4-bit, GPU-katman-offload'lı bir yerel çekirdek etkileşimli dili ve kontrolü üstlenir; çekirdeğin hesaplayamadığı her şeyi gerçek bir araç kaydı, geri-getirmeli bellek ve zorluk-farkında bir yönlendirici karşılar; ve yalnızca en ağır mimari/doğrulama işleri için, etkileşim döngüsünün asla bağımlı olmadığı isteğe bağlı bir harici uzmana danışılır. Dağıtım donanımında ölçülmüş çıkarım hızını, tekrarlanabilir bir anlam-sadakati değerlendirmesini (deterministik kural-bayrakları + sıcaklık-0 bir LLM yargıç) ve aynı yığın üzerine kurulu canlı, herkesçe test-edilebilir bir ürünü raporluyoruz. Yapısal sınırları — canlı telemetrinin etkileşimli döngüyle GPU çekişmesine girdiğini gösterdiği, ölçülüp devreye alınıp SONRA kaldırılan eski bir katmanlı ("düşünce tankı") tasarım dahil (§8) — açıkça belirtiyoruz. Bu, gerçek ölçümlü bir sistem gösterimidir; benchmark yenen bir iddia değil.

Anahtar kelimeler — uç yapay zekâ · cihaz-üstü çıkarım · LLM ajanları · araç kullanımı · geri-getirmeli üretim · kuantizasyon · veri egemenliği · kendini-geliştiren sistemler.

1Giriş

Yetenekli ajan asistanlar tipik olarak bulutta barındırılan çok büyük (70B–405B+) modellerle sunulur. Bu üç maliyet getirir: altyapı ve enerji yükü, veri dışa-akışı (kullanıcı verisi cihazı terk eder) ve sürekli token-başı faturalandırma. Kişisel ve küçük-işletme görevlerinin büyük bir bölümü için bu maliyetler orantısızdır.

Biz farklı bir soru soruyoruz: tüm yeteneği tek modelin ağırlıklarına yüklemezsek, sabit, mütevazı ve çevrimdışı bir donanımda ne kadar işe yarar, dürüst otonomi elde edilebilir? ORDIS bunun cevabı — yerelde sunulan TEK bir modelin; gerçek araçlar, bellek ve disiplinli yönlendirmeyle eşleştiğinde gerçekten işe yarar bir ajan sistemine çıpa olabildiğinin, üstelik tasarım kararlarının (mimariden vazgeçme kararı dahil) iddia değil ölçümle gösterilebildiğinin bir varlık kanıtı.

Katkılar

  1. Egemen uç yapay zekâ için somut bir dağıtık-biliş mimarisi ve onun 4 GB'da ölçülmüş çalışma zarfı.
  2. Anti-tiyatro doğrulama kapılı bir kendini-genişletme hattı — üretilen araçlar kayıttan önce sözdizimi, sandbox ve placeholder/sahte-başarı reddi filtresini geçmek zorundadır.
  3. Grounded öz-algı — küçük bir modelin kendi mimarisi ve yükü hakkındaki soruları uydurmadan yanıtlamasını sağlayan bir canlı-telemetri yolu.
  4. Bir LLM mimarı ile insan operatörün işlevsiz (“tiyatro”) alt-sistemleri döngüsel olarak ayıkladığı — VE canlı telemetrinin net-negatif olduğunu kanıtladığı mimari katmanları geri aldığı (§8) — insan-döngüde bir birlikte-geliştirme metodolojisi (“profesör–çırak”).

2Arka Plan ve Motivasyon

Dağıtım hedefi, RTX 3050 Laptop GPU (4 GB VRAM) bulunan tek bir Ubuntu 26.04 iş istasyonudur. Tasarım kısıtı kesindir: sistem çevrimdışı, dış çıkarım API'si olmadan ve hiçbir kullanıcı verisi makineyi terk etmeden işe yarar kalmalıdır. Naif bakışta 4 GB bütçe, 4-bit kuantizasyonda ~4B parametrenin ötesindeki modelleri eler gibi görünür. Pratikte kısmi GPU-katman offload (§5), bir modelin katmanlarının yalnızca bir kısmını GPU'da tutup gerisini CPU/RAM'de çalıştırarak daha büyük bir modelin çalışmasına izin verir — hız karşılığında kapasite kazanılır. Mühendislik problemi bu yüzden “hangi dev model” değil, “4 GB nasıl paylaştırılır, ne kadar hız kapasiteye feda edilir”dır.

3Mimari: Dağıtık Biliş

Yetenek tekil değil, bileşiktir — tek bir çekirdek model artı araçlar, bellek ve bir yönlendirici:

Çekirdek. Yerelde sunulan tek bir ~12B'lik instruct model, 4-bit; katmanlarının bilinçli ayarlanmış bir kısmı GPU'ya kaydırılır (§5), gerisi CPU/RAM'de çalışır. Diyalog, niyet ve kontrolü üstlenir. Devredebileceğini hesaplamaz; aritmetik, geri-getirme, girdi/çıktı ve kod çalıştırma araçlara itilir.

Harici uzman (yalnız en ağır, isteğe bağlı). Çok büyük refactor ya da sıfırdan mimari için yönlendirici, yapılandırılmışsa harici bir sınır-model modeline danışabilir — egemenlikten tek kasıtlı taviz, en ağır işlere kapılı; etkileşim döngüsü buna asla bağımlı değildir ve hiçbiri yapılandırılmamışsa sessizce bozulmak yerine bunu dürüstçe bildirir.

Araçlar ve bellek. Çalıştırılabilir yeteneklerden canlı bir kayıt (dosya sistemi, kabuk, tarayıcı kontrolü, web tarama, PDF, OSINT, finans, içerik üretimi) zemin-gerçeği döndürür; CPU/disk'teki bir vektör deposu uzun-vadeli belleği tutar, böylece kalıcılık kıt VRAM'i ya da bağlamı tüketmez.

Zorluk-farkında yönlendirici. Her istek derecelendirilir: önemsiz → çekirdek doğrudan cevaplar; çok-zor mimari/refactor → yapılandırılmışsa harici uzman; aksiyon-gerektiren → ajan döngüsü. Sohbet akıcı kalır çünkü çekirdek hiçbir zaman bir ağ çağrısını bekleyerek bloklanmaz.

Bu mimarinin daha önceki bir sürümü, çekirdek ile harici uzman arasında ara-katman olarak eşzamansız çağrılan ikinci, daha ağır bir yerel model (bir "düşünce tankı", ~14B) de çalıştırıyordu. Ölçüldü, devreye alındı ve daha sonra kaldırıldı — fikir ilke olarak yanlış olduğu için değil, canlı üretim telemetrisi bunun etkileşimli çekirdekle AYNI tek GPU için rekabet ederek olağan kullanımda gerçek sohbet gecikmesini kötüleştirdiğini gösterdiği için. Ölçülen başarısızlık kipi için §8'e bakınız. Bunu raporluyoruz çünkü ölçülmüş bir negatif sonuç da bir sonuçtur.

4Temel Mekanizmalar

4.1 · Anti-tiyatro doğrulama kapılı kendini-genişletme

Sistem, doğal dildeki bir yetenek tarifinden yeni araçlar sentezleyebilir. Üretilen kod şu aşamalardan geçer: (i) sözdizimi doğrulama, (ii) sandbox çalıştırma ve (iii) gerçek girdi/çıktı, ağ veya hesaplama olmadan placeholder işaretleri ya da sabit “başarıyla tamamlandı” dönüşü gibi taklit-başarı sergileyen kodu reddeden bir anti-tiyatro kapısı. Yalnızca üçünü de geçen kod kaydedilir. Bu kapı vardır çünkü sandbox'ta çağrılabilir olmak tek başına yetmez: başarı string'i döndüren bir stub çağrılabilir ama işe yaramazdır.

4.2 · Grounded öz-algı (anti-halüsinasyon)

Kendi altyapısını anlatması istenen küçük modeller, akla yatkın ama yanlış yığınlar uydurmaya eğilimlidir (örneğin ilgisiz bir çatı ya da bağımlılık icat etmek). ORDIS bunun yerine bu tür soruları canlı telemetriden yanıtlar — çıkarım sunucusunu, GPU'yu, hata logunu ve araç kaydını sorgular — ve belirsizlikte varsayılan olarak “loglarıma bakmam lazım” der. Bu, üretici bir görevi (halüsinasyona yatkın) zemin-gerçek üzerinde bir geri-getirme görevine dönüştürür.

4.3 · Profesör–çırak birlikte-geliştirme

Geliştirme döngüsel ilerler: bir LLM mimarı önerir ve denetler; insan operatör yönlendirir ve karar verir; işlevsiz alt-sistemler (“tiyatro”) tespit edilip ya gerçek implementasyona çevrilir ya da düzenli aralıklarla kaldırılır. Bu bir metodoloji iddiasıdır, bir performans iddiası değil.

5Uygulama ✓ CANLI DOĞRULANDI

Çekirdek model~12B instruct (Gemma ailesi), 4-bit — stok instruct ağırlıkları üzerine persona/araç-orkestrasyon sistem promptu bindirilmiş. Yazım anında gömülü bir ince-ayar YOK; veri-setiyle-ayarlanmış (LoRA) bir "bake" boru hattı planda ama bu modele henüz uygulanmadı — çoktan eğitilmiş gibi ima etmek yerine bunu açıkça belirtiyoruz.
Harici uzmansınır-model; yalnız en ağır refactor/mimari için, yapılandırılmışsa (etkileşim döngüsü asla gerektirmez)
Çıkarım motorullama.cpp / ollama, GGUF Q4_K_M, GPU katman-offload (CUDA cc 8.6 için derlendi)
DonanımRTX 3050 Laptop — 4096 MiB VRAM · i5-11400H · 30 GB RAM
Yükte çekirdek48 katmanın 18'i GPU'da (~3.4 GB VRAM), gerisi CPU/RAM
Embeddingnomic-embed-text, CPU'ya pinli (0 VRAM)
Vektör deposuChromaDB (CPU / disk)
Araç kaydı264 kayıtlı araç (canlı sayı)
Ana sistemUbuntu 26.04 LTS · Docker

6Ölçülmüş Çıkarım Hızı ✓ BU MAKİNEDE ÖLÇÜLDÜ

Tek-akış üretim, dağıtım donanımındaki canlı ollama uç noktasına karşı ölçüldü; 48 transformer katmanının 18'i 4 GB GPU'ya kaydırılmış durumda (gerisi CPU/RAM'de — VRAM bağlayıcı kısıt).

~12B, 48 katmanın 18'i GPU'da5–8 tok/sn, art arda iki canlı örnek: eşzamanlı arka-plan yükü altında 4.9 ve 5.9 tok/sn; GPU'nun başka türlü boşta olduğu önceki ölçümlerde ~8.5 tok/sn'ye kadar

Bulgu. Bu kutuda hız, yalnızca katman-sayısından değil büyük ölçüde çekişmeden belirleniyor: aynı model/offload yapılandırması, o an tek GPU'da başka ne çalıştığına bağlı olarak kabaca ±%40 salınıyor. Bu, §8'de anlatılan katmanlama-başarısızlığının doğrudan, ölçülmüş sonucudur — aynı zamanda önceki 4-katmanlı hız kıyaslamasının (4B/8B/14B/32B, bu geçişle geçersiz kılındı) burada birebir bir rakam olarak tekrarlanmamasının nedenidir: o rakamlar artık dağıtılmayan bir model ailesini ve offload merdivenini anlatıyordu. Doğru bir tarih olup yanıltıcı bir şimdiki-zaman iddiası olacak bir kıyaslamayı korumak yerine, şu an canlı olanı raporluyoruz.

7Değerlendirme

Yapılabilirlik. Tam yığın (etkileşimli ~12B çekirdek + 264-araç kaydı + RAG + öz-teşhis) 4 GB VRAM / 30 GB RAM içinde, çekirdek döngüsü çevrimdışı çalışır. Maliyet / egemenlik. Çekirdek için $0 marjinal çıkarım maliyeti; veri dışa-akışı yok; etkileşim döngüsü %100 çevrimdışı-yetkin.

Anlam-sadakati harness'ı (tekrarlanabilir). Persona ve loss eğrileri anlam kaymasını yakalamaz — bir model akıcı olup yine de yanlış okuyabilir. Held-out zorlayıcı promptlara (deyim, çok-anlamlılık, olumsuzluk-kapsamı, gönderim takibi) verilen cevapları iki katmanla puanlarız: deterministik bir kural-bayrak katmanı (formalite sızıntısı, calque, tiyatro, kimlik karışması) ve sıcaklık-0 tarafsız bir LLM yargıç (anlam-sadakati + akıcılık 0–5). Yargıç ve promptlar sabit olduğu için sürümler doğrudan kıyaslanabilir. Tarihsel baseline (artık geçersiz kılınan önceki 4B-ailesi model): ortalama anlam-sadakati 1.5/5, akıcılık 2.68/5, 0 kural-bayrağı — yüzeyde temiz ama anlamda zayıf; tam da harness'ın açığa çıkardığı hata. Harness, güncel ~12B çekirdeğe karşı henüz uçtan-uca yeniden çalıştırılmadı; gerçekleşmemiş bir yeniden-ölçümü ima etmek yerine bu boşluğu açıkça raporluyoruz. Harness sistemle birlikte gelir, tam da her gelecek sürümün bu baseline'a doğrudan kıyaslanabilmesi için.

Çürütülebilir, canlı bir artefakt. Aynı egemen yığın canlı bir public micro-servisi barındırır — offline bir secret/PII tarayıcı — gaia-api.soundbygaia.com adresinde. Bir okuyucu POST /scan ile bir kod parçası gönderip yapısal bulgular alabilir; böylece anlatılan yığının gerçek, çalışan bir ürün ürettiğini doğrular. Bu makalenin bir parçası şu an herkesçe test edilebilir.

8Sınırlar (açıkça)

9Tartışma ve Gelecek Çalışma

Katı kaynak ve egemenlik kısıtları altında, anlamlı bir görev bandında mimari ve ölçülmüş model-seçimi ham parametrenin yerine geçebilir — ama yalnızca eklenen her mimari katman, temel sisteminkiyle AYNI ölçüm standardına tutulduğunda; gerçek eşzamanlı üretim yükü altında doğrulanmamış katmanlama, sessizce getirdiğinden fazlasına mal olabilir. Gelecek çalışma: (1) sabit ajan döngüsünde yeniden-üretilebilir araç-başarı ve görev-tamamlama koşum-ortamı; (2) hız rakamlarının donanımlar-arası yeniden üretimi; (3) anlam-sadakati harness'ını güncel çekirdeğe karşı yeniden çalıştırıp tam sürümler-arası skor geçmişini yayımlama; (4) anti-tiyatro kapısı ile model-agnostik öz-algıyı yeniden-kullanılabilir bileşenler olarak formelleştirme.

10Sonuç

ORDIS; işe yarar, egemen ve kendini-genişleten bir ajan-yapay zekânın 4 GB'lık bir tüketici dizüstünde elde edilebileceğinin mühendislikle kurulmuş bir gösterimidir — yeter ki zekâ (model, araçlar, bellek, yönlendirme) bir sistemin özelliği olarak ele alınsın, model ve mimari kararları varsayımla değil ölçümle yapılsın ve sistem bir dürüstlük standardına tutulsun: her yetenek gerçek bir şeye karşılık gelir, öz-raporlar ölçümden gelir, ölçümün yanlışladığı mimari görüntü için tutulmak yerine kaldırılır, ve sonucun bir kısmı herkesçe çürütülebilirdir.

Kaynaklar

  1. Google DeepMind. Gemma teknik rapor ailesi. (temel model)
  2. Hu vd. LoRA: Low-Rank Adaptation of Large Language Models. 2021. (planlanan ince-ayar yöntemi, henüz uygulanmadı — §5)
  3. Gerganov vd. llama.cpp / GGUF — verimli LLM çıkarımı ve k-quant kuantizasyon.
  4. Yao vd. ReAct: Synergizing Reasoning and Acting in Language Models. 2023.
  5. Lewis vd. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. 2020.
  6. ChromaDB — açık kaynak embedding veritabanı.

Bu whitepaper çürütülebilir olacak şekilde yazılmıştır. Sistem incelemeye açıktır; kaynak defteri, donanım sınırları ve hata modları, bir okuyucunun doğrudan doğrulayabilmesi ya da çürütebilmesi için açıkça belirtilmiştir.