
Memo'nun donanım ihtiyacı tamamen sohbeti nasıl çalıştırdığına bağlı — harici bir API sağlayıcısı bağlamak (OpenAI, Claude, Gemini, OpenRouter ve diğerleri) neredeyse hiçbir şey gerektirmezken, sohbet modelini tamamen yerel çalıştırmak gerçek RAM ve ideal olarak bir GPU ister. Bunlar oynama payı olan tek bir sayı değil, gerçekten iki farklı profil, bu yüzden aşağıda ayrı ayrı ele alınıyor. Her iki durumda da hafıza (RAG) her zaman yerel ve her zaman hafiftir — bu sayfanın devamındaki "Gömme Modeli Gereksinimleri"ne bakın.
Sohbet için bir bulut sağlayıcı bağlıyorsan (OpenAI, Claude, Gemini, Grok, Groq, OpenRouter vb.) ve hafıza için sadece küçük yerel gömme modelini çalıştırıyorsan, Memo gerçekten hafiftir:
| Bileşen | Minimum | Önerilen |
|---|---|---|
| RAM | 1 GB | 4 GB |
| Disk alanı | 1 GB boş | 2 GB boş |
| CPU | Herhangi bir x86-64 veya ARM64 | Herhangi bir modern çok çekirdekli |
| GPU | Gerekmez | Gerekmez |
| İnternet | Gerekli — her sohbet mesajı sağlayıcına gider | Geniş bant |
1 GB minimum, backend/Flutter uygulamasının kendi ayak izi artı yerel gömme modelinin ihtiyaç duyduğu ~500 MB'ı kapsıyor — bu modda RAM'e yüklenecek bir sohbet modeli hiç yok. Bu, çok gigabaytlık bir yerel model indirmek istemeyen çoğu kullanıcı için gerçekçi taban, ve sadece teknik olarak açılabilir değil, o tabanda gerçekten kullanılabilir.
Sohbet modelinin kendisini kendi makinende çalıştırmayı tercih ediyorsan — tamamen çevrimdışı, API maliyeti yok, veri cihazından çıkmıyor — aşağıdaki gereksinimler API-sağlayıcı tabanının üzerine ekleniyor:
| Bileşen | Minimum | Önerilen |
|---|---|---|
| RAM | 8 GB | 16 GB |
| Disk alanı | 4 GB boş | 20 GB boş (modeller her biri 1–15 GB arası) |
| CPU | AVX2 destekli x86-64 (Intel Haswell 2013+ veya AMD Excavator 2015+) | AVX2 destekli x86-64, 8+ çekirdek |
| GPU | Gerekli değil — CPU çıkarımı çalışır | 6 GB+ VRAM'li NVIDIA (CUDA 11.7+) |
| İnternet | Yalnızca model indirmeleri için gerekli | Model indirmeleri için geniş bant |
8 GB RAM ile CPU'da ~3B parametreye kadar nicelenmiş modelleri rahatça çalıştırabilirsiniz. GPU ile llama.cpp katmanları VRAM'e yükleyerek çıkarım hızını önemli ölçüde artırır — 6 GB VRAM'li bir GPU, etkileşimli hızlarda 7–8B parametreli modelleri işler.
İkisini karıştırmana hiçbir şey engel değil: sohbet için bulut sağlayıcı + hafıza için yerel gömme modeli (en hafif, en yaygın gerçek dünya kurulumu), her ikisi için de tamamen yerel bir kurulum, ya da sohbet başına yerel/bulut model arasında geçiş. Belirli bir yerel model boyutunun RAM/VRAM'e tam olarak neye mal olduğu için aşağıdaki "Model Boyutu ve Donanım Rehberi"ne bakın.
| İS | Sürüm | Durum |
|---|---|---|
| Windows | 10, 11 (x86-64) | ✅ Tam destek |
| Linux | Debian 11+, Ubuntu 20.04+, Fedora 38+, Arch | ✅ Tam destek |
| macOS | Apple Silicon (M1+) ve Intel (x86-64) | ✅ Evrensel ikili |
| Android | 8.0+ (API 26+) | ✅ Yalnızca yardımcı |
Temiz bir Linux kurulumunda şu sistem kütüphanelerine ihtiyacınız olabilir:
# Debian / Ubuntu
sudo apt install libgtk-3-0 libblkid1 liblzma5 libgcrypt20
# Fedora
sudo dnf install gtk3 libblkid xz-libs libgcrypt
# Arch
sudo pacman -S gtk3 util-linux xz libgcrypt
Bunlar genellikle masaüstü Linux'ta zaten mevcuttur. AppImage çoğu bağımlılığı içinde barındırır.
| GPU Üreticisi | API | Destekleniyor | Gerekli Bellek |
|---|---|---|---|
| NVIDIA | CUDA | ✅ Evet | 4 GB+ VRAM önerilir |
| AMD | ROCm / Vulkan | ✅ Evet (llama.cpp ile) | 4 GB+ VRAM önerilir |
| Apple | Metal (MPS) | ✅ Evet | Birleşik bellek |
| Intel | SYCL / Vulkan | ⚠️ Deneysel | Değişir |
NVIDIA GPU'lar için CUDA Toolkit 11.7+ ve NVIDIA sürücü 525+ kurun. AMD için ROCm 5.7+ önerilir. Apple Silicon, Metal ile kutudan çıktığı gibi çalışır.
| Model Boyutu | RAM (Yalnız CPU) | RAM + VRAM (GPU yükleme) | Tipik Hız |
|---|---|---|---|
| 1–3B (Gemma 3 4B, Phi-3 mini) | 4–6 GB | 4 GB RAM + 2 GB VRAM | CPU'da hızlı, GPU'da anında |
| 7–8B (Llama 3.1 8B, Qwen 3 8B) | 8–12 GB | 8 GB RAM + 4 GB VRAM | CPU'da kullanılabilir, GPU'da hızlı |
| 12–14B (Qwen 2.5 14B) | 12–16 GB | 12 GB RAM + 6 GB VRAM | CPU'da yavaş, GPU'da hızlı |
| 32B+ | 24+ GB | 16 GB RAM + 12 GB VRAM | GPU gerektirir |
Model Mağazası, tespit edilen RAM ve VRAM'inize göre hesaplanan donanım uygunluk rozetleri gösterir — "Cihazınıza uyar", "CPU için uygun", "Çok büyük".
RAG hafıza sistemi ayrı bir gömme modeli kullanır (örn. nomic-embed-text-v1.5). Bu, GPU varlığından bağımsız olarak CPU'da verimli çalışan ~137M parametreli bir modeldir. ~500 MB RAM gerektirir ve modern bir CPU'da saniyede ~100 token işler.
Gömme modelleri tasarım gereği hafiftir. Sohbet için bulut AI (OpenAI, Claude) kullanırken, yerel bir gömme modeli bağımsız olarak hafızayı yönetebilir — iki dünyanın en iyisini birleştirir.
Veri dizini kullanımla birlikte büyür:
| Bileşen | Başlangıç | 1 Ay Sonra (tahmini) |
|---|---|---|
| Modeller | 2–16 GB | İndirmelere bağlı |
| Hafıza (RAG deposu) | < 1 MB | ~50–200 MB |
| Oturumlar (sohbet geçmişi) | < 1 MB | ~10–100 MB |
| WhatsApp mesajları | 0 | ~50–500 MB |
| Takvim etkinlikleri | < 10 KB | < 1 MB |
| Bulut senk. önbelleği | 0 | ~10 MB |
Hafıza birleştirme günlük çalışır, RAG deposunu kompakt tutmak için yakın-benzer gömme vektörlerini (kosinüs benzerliği ≥ 0.92) birleştirir.