Je kunt verschillende
DeepSeek-modellen lokaal op Windows, macOS en Linux gebruiken. Je opdrachten en documenten hoeven dan niet naar de officiële DeepSeek-chat of API te worden gestuurd.
Op een gewone computer installeer je doorgaans een kleinere DeepSeek R1-distillatie. De volledige V4 Pro, V4 Flash en R1 671B zijn te groot voor normale consumentenhardware.
Voor het verschil tussen bedrijf, chatbot, API en modellen lees je onze
complete DeepSeek-uitleg.
Waarom DeepSeek lokaal draaien?
Lokaal gebruik biedt:
- meer controle over gegevens;
- offline gebruik na het downloaden;
- geen kosten per token;
- keuze uit verschillende modelgroottes;
- een lokale API voor eigen software;
- minder afhankelijkheid van een externe dienst.
Nadelen zijn:
- grote downloads;
- hoog geheugenverbruik;
- tragere antwoorden op zwakke hardware;
- eigen beveiliging en onderhoud;
- geen ingebouwde actuele webkennis;
- lagere kwaliteit bij kleine modellen.
Kun je DeepSeek V4 lokaal draaien?
De modelgewichten van V4 zijn beschikbaar, maar de volledige modellen zijn enorm. DeepSeek noemt voor V4 Pro 1,6 biljoen totale parameters en voor Flash 284 miljard.
Zelfs met quantisatie vraagt dit gespecialiseerde server- of multi-GPU-hardware. Een modelpagina die een downloadknop toont, betekent niet dat het model bruikbaar op een laptop draait.
Voor thuisgebruik zijn kleinere R1-distillaties realistischer. Ons
DeepSeek-modellenoverzicht legt de families uitgebreider uit.
Welk lokaal model past bij je computer?
De onderstaande waarden zijn praktische richtlijnen. Werkelijk geheugengebruik hangt af van quantisatie, contextlengte, runtime, besturingssysteem en GPU.
| Model | Ollama-download | Praktische geheugenklasse |
| R1 1.5B | Circa 1,1 GB | 8 GB RAM |
| R1 7B | Circa 4,7 GB | 8–12 GB RAM |
| R1 8B | Circa 5,2 GB | 12–16 GB RAM |
| R1 14B | Circa 9 GB | 16–24 GB RAM |
| R1 32B | Circa 20 GB | 32 GB RAM of meer |
| R1 70B | Circa 43 GB | 64 GB RAM of meer |
| R1 671B | Circa 404 GB | Server of multi-GPU-systeem |
Meer context vraagt extra geheugen. Begin daarom met een bescheiden contextinstelling en een kleiner model.
Voor veel gebruikers is R1 8B de beste eerste test. Wie 32 GB of meer geheugen heeft, kan 14B of 32B proberen.
Methode 1: DeepSeek installeren met Ollama
Ollama is een eenvoudige runtime voor lokale taalmodellen.
Stap 1: download Ollama
Ga naar:
https://ollama.com/download
Kies de officiële versie voor Windows, macOS of Linux en volg de installatie.
Stap 2: open Terminal of PowerShell
Controleer of Ollama beschikbaar is:
ollama --version
Stap 3: start DeepSeek R1 8B
ollama run deepseek-r1:8b
Ollama downloadt het model en opent daarna een lokale chat.
Andere varianten:
ollama run deepseek-r1:1.5b
ollama run deepseek-r1:7b
ollama run deepseek-r1:14b
ollama run deepseek-r1:32b
ollama run deepseek-r1:70b
Download niet automatisch het grootste model. Een te groot model kan extreem langzaam worden of helemaal niet laden.
Stap 4: stel een vraag
Leg in het Nederlands uit hoe een warmtepomp werkt.
Gebruik maximaal vijf korte alinea’s.
Stop de chat met de aangegeven terminalcombinatie of sluit de sessie.
Stap 5: bekijk geïnstalleerde modellen
ollama list
Stap 6: verwijder een model
ollama rm deepseek-r1:8b
Controleer de exacte modelnaam met ollama list voordat je iets verwijdert.
Ollama als lokale API gebruiken
Ollama start doorgaans een lokale dienst op poort 11434.
Voorbeeld:
curl http://localhost:11434/api/chat \
-d '{
"model": "deepseek-r1:8b",
"messages": [
{
"role": "user",
"content": "Geef drie voordelen van lokale AI."
}
],
"stream": false
}'
Stel deze lokale poort niet zonder authenticatie open naar het internet. Een onbeveiligde AI-server kan documenten, prompts en rekenkracht blootstellen.
Voor gehost DeepSeek-gebruik volg je de afzonderlijke
API-handleiding.
Methode 2: DeepSeek installeren met LM Studio
LM Studio biedt een grafische interface en is daardoor toegankelijk voor gebruikers die liever niet in een terminal werken.
Stap 1: installeer LM Studio
Ga naar:
https://lmstudio.ai/
Download de officiële versie voor je besturingssysteem.
Stap 2: open Discover
Ga in LM Studio naar het onderdeel waarmee je modellen zoekt. Zoek bijvoorbeeld naar:
DeepSeek R1 8B
LM Studio kan ondersteunde modellen vanuit Hugging Face downloaden.
Stap 3: controleer model en aanbieder
Let op:
- modelnaam;
- oorspronkelijke ontwikkelaar;
- quantisatie;
- bestandsgrootte;
- licentie;
- reputatie van de aanbieder van de quantisatie.
Veel compacte GGUF-bestanden zijn door derden gequantiseerd. Controleer daarom of het bestand overeenkomt met het bedoelde officiële model.
Stap 4: kies een quantisatie
Een 4-bitvariant zoals Q4 is vaak een goede start. Hogere quantisatie kan kwaliteit behouden, maar vraagt meer geheugen en opslag.
LM Studio adviseert een 4-bitvariant of hoger wanneer je computer dat aankan.
Stap 5: laad het model
Open het gedownloade model en kies een beperkte contextlengte. Start met een eenvoudige vraag en controleer snelheid en geheugenverbruik.
Stap 6: gebruik Local Server
LM Studio kan een lokale, vaak OpenAI-compatibele server starten. Controleer host, poort en toegangsinstellingen voordat je andere programma’s verbindt.
Documenten lokaal analyseren
Een lokaal model weet niet automatisch wat er in je bestanden staat. Je kunt documenten via LM Studio of aanvullende lokale software toevoegen, afhankelijk van de gebruikte functie.
Voor betrouwbare documentanalyse:
- gebruik tekstgebaseerde PDF’s;
- controleer OCR bij scans;
- verdeel zeer lange documenten;
- behoud paginanummers;
- vraag om citaten;
- controleer passages zelf;
- voorkom dat plugins documenten extern versturen.
Lokale verwerking is alleen lokaal wanneer de volledige keten lokaal blijft.
Werkt lokale DeepSeek volledig offline?
Na het downloaden kan het model zelf zonder internet genereren. De gebruikte app kan nog wel:
- controleren op updates;
- modelinformatie ophalen;
- telemetry verzenden;
- externe tools of plugins gebruiken;
- cloudback-ups activeren.
Voor gevoelige toepassingen controleer je netwerkverkeer, instellingen en documentopslag. Onze analyse
Is DeepSeek veilig? behandelt de verschillen tussen chat, API en lokale modellen.
Veelvoorkomende problemen
Het model is erg langzaam
Kies een kleiner model, verklein de context en sluit andere zware programma’s. Controleer of GPU-versnelling wordt gebruikt.
Het model laadt niet
Waarschijnlijk is onvoldoende RAM of VRAM beschikbaar. Probeer een kleinere of sterker gequantiseerde variant.
Antwoorden stoppen plotseling
Verhoog de maximale output binnen de grenzen van je geheugen. Controleer ook of de context niet volledig gevuld is.
Het antwoord is slecht Nederlands
Geef expliciete taalinstructies en een voorbeeldstijl. Een groter model levert doorgaans betere taal dan een zeer kleine variant.
Het model kent recent nieuws niet
Lokale modellen hebben een vaste kennisgrens en geen automatische webtoegang. Voeg zelf gecontroleerde bronnen toe of gebruik een afzonderlijke zoektool.
De computer raakt vol
Bekijk de modellenlijst en verwijder ongebruikte varianten. Grote modellen kunnen tientallen gigabytes opslag innemen.
Lokaal model of officiële API?
Kies lokaal wanneer:
- documenten niet naar een externe aanbieder mogen;
- offline gebruik nodig is;
- je voldoende hardware hebt;
- volledige controle belangrijk is;
- een kleiner model voldoende presteert.
Kies de API wanneer:
- je de beste V4-kwaliteit nodig hebt;
- snelheid en schaal belangrijk zijn;
- je geen eigen hardware wilt beheren;
- de lage tokenkosten aantrekkelijker zijn;
- de gegevens volgens beleid extern mogen worden verwerkt.
Conclusie
Voor de meeste gebruikers is Ollama met deepseek-r1:8b de eenvoudigste lokale start. LM Studio is aantrekkelijker wanneer je een grafische interface en visuele modelkeuze wilt.
Verwacht niet dat een kleine lokale R1-distillatie dezelfde kwaliteit biedt als V4 Pro in de officiële cloud. Je ruilt een deel van snelheid en modelkracht in voor privacy, controle en offline gebruik.
Begin klein, meet snelheid en kwaliteit en installeer pas daarna een grotere variant.