LM Studio kan vóór het laden van een AI-model inschatten hoeveel geheugen een gekozen configuratie nodig heeft. Vooral de contextlengte verdient aandacht als korte chats soepel werken, maar lange gesprekken of documenten voor vertragingen of geheugenproblemen zorgen.
De
officiële uitleg van LM Studio over geheugenschattingen laat zien dat gebruikers het geheugengebruik vooraf kunnen vergelijken. Daardoor kun je eerst testen of de contextinstelling het probleem veroorzaakt, voordat je naar een kleiner model of nieuwe hardware kijkt.
Waarom vraagt hetzelfde AI-model ineens meer geheugen?
Een gedownload modelbestand en een draaiende AI-chat gebruiken niet dezelfde hoeveelheid geheugen. De modelgewichten nemen een relatief vaste hoeveelheid ruimte in, maar tijdens het gebruik heeft het model extra werkgeheugen nodig om invoer en gegenereerde tekst te verwerken.
Een belangrijk onderdeel daarvan is de KV-cache. Veel taalmodellen bewaren hierin informatie uit eerder verwerkte tokens, zodat bepaalde berekeningen niet bij ieder volgend token opnieuw hoeven te worden uitgevoerd.
Hugging Face legt in zijn documentatie uit hoe deze KV-cache werkt. De cache versnelt het genereren van tekst, maar vraagt tegelijkertijd extra geheugen.
De contextlengte bepaalt hoeveel tokens het model binnen één sessie kan meenemen. Tokens zijn kleine teksteenheden, zoals woorden, woorddelen en leestekens. Een lange chatgeschiedenis, grote prompt of meegestuurd document kan daardoor aanzienlijk meer geheugen vragen dan een korte vraag.
Het modelbestand verandert ondertussen niet. De benodigde werkruimte doet dat wel.
Een grotere context vraagt meer geheugen
Een model dat bijvoorbeeld 32.000 of 128.000 tokens ondersteunt, hoeft niet automatisch met die maximale context te worden geladen.
Ook
Ollama waarschuwt in zijn documentatie over contextlengte dat een grotere context meer geheugen vraagt. Hoe groot het verschil precies is, hangt onder meer af van het model, de configuratie en de beschikbare hardware.
De maximale context van een model is daarom vooral een technische bovengrens. Het is niet automatisch de beste instelling voor iedere computer of taak.
Wie nog geen werkende
lokale AI-omgeving heeft, kan eerst onze handleiding DeepSeek lokaal installeren met Ollama en LM Studio gebruiken. Voer de onderstaande vergelijking daarna met hetzelfde modelbestand uit.
Test 4.096 en 8.192 tokens voordat je hardware vervangt
Een eenvoudige vergelijking kan snel zichtbaar maken hoeveel invloed de contextlengte op jouw systeem heeft. Gebruik bijvoorbeeld 4.096 en 8.192 tokens als testwaarden, mits het gekozen model beide contextlengtes ondersteunt.
- Noteer je uitgangspunt. Schrijf de exacte modelnaam, quantisatie en versie van LM Studio op. Quantisatie is een techniek waarmee de modelgewichten compacter worden opgeslagen. Houd tijdens de test hetzelfde modelbestand en dezelfde overige instellingen aan.
- Test 4.096 tokens. Open de laadinstellingen van LM Studio, stel de contextlengte in op 4.096 tokens en noteer de geschatte geheugenbehoefte. De instellingen per model staan volgens LM Studio ook onder My Models.
- Verhoog alleen de contextlengte. Stel vervolgens 8.192 tokens in en vergelijk de nieuwe geheugenschatting. Verander de GPU-offload niet. GPU-offload bepaalt welk deel van het model door de grafische processor wordt verwerkt.
- Test daarna een echte taak. Gebruik een configuratie die binnen het beschikbare geheugen past. Begin met een nieuwe chat en een korte tekst. Start daarna opnieuw een aparte chat met een langere invoer die binnen dezelfde contextlimiet past. Vraag in beide gevallen bijvoorbeeld om een antwoord van maximaal honderd woorden en vergelijk de responstijd en eventuele foutmeldingen.
Negeer een geheugenwaarschuwing niet alleen om de benchmark af te maken. Het doel is juist om een bruikbare configuratie te vinden.
LM Studio kan het geheugen testen zonder het model te laden
Gebruikers van de opdrachtregel kunnen dezelfde vergelijking uitvoeren met de LM Studio CLI.
LM Studio documenteert hiervoor de optie --estimate-only. Zoek eerst met lms ls naar de juiste modelcode en vervang MODEL vervolgens in deze opdrachten:
lms load MODEL --estimate-only --context-length 4096
lms load MODEL --estimate-only --context-length 8192
Het voordeel hiervan is dat LM Studio de geheugenbehoefte kan schatten zonder het model daadwerkelijk te laden. Het verschil tussen beide resultaten geeft een concreter beeld van de impact van een grotere context op jouw configuratie.
Langzamer antwoorden betekent niet automatisch te weinig geheugen
Meet tijdens de test niet alleen de totale wachttijd. De eerste aanvraag kan langer duren doordat het model eerst in het geheugen moet worden geladen.
Ollama maakt in zijn
API-documentatie onderscheid tussen verschillende prestatiemetingen, waaronder het laden van het model, het verwerken van de prompt en het genereren van tokens.
Dat onderscheid is belangrijk. Een langere totale wachttijd bewijst op zichzelf niet dat je tegen een geheugenlimiet aanloopt.
Kijk daarom ook naar foutmeldingen, geheugenschattingen, de snelheid waarmee tokens worden gegenereerd en de omstandigheden waaronder de vertraging ontstaat.
Een pdf toevoegen betekent niet dat iedere pagina naar het model gaat
Bij documenten speelt nog een tweede factor: hoe LM Studio de inhoud aan het taalmodel aanbiedt.
Past een document binnen de beschikbare context, dan kan LM Studio de inhoud rechtstreeks aan de context toevoegen. Bij grotere documenten kan het programma volgens de
documentatie over documentchats van LM Studio overschakelen op retrieval-augmented generation, oftewel RAG.
RAG betekent dat het systeem eerst relevante tekstfragmenten uit het document zoekt en vervolgens alleen die passages aan het taalmodel aanbiedt.
Dat heeft gevolgen voor de manier waarop je lokale AI moet testen.
Een vraag over één specifieke clausule vraagt bijvoorbeeld maar om een klein deel van een document. Een opdracht om uitzonderingen uit verschillende hoofdstukken met elkaar te vergelijken kan informatie uit veel meer passages vereisen.
Een computer kan die tweede opdracht technisch probleemloos uitvoeren, terwijl het antwoord toch onvolledig is doordat niet alle relevante passages zijn opgehaald.
Test daarom niet alleen snelheid, maar ook antwoordkwaliteit
Gebruik voor een documenttest bij voorkeur een bestand waarvan je zelf enkele controleerbare details kent. Denk aan een ingangsdatum, een uitzondering op een regel en een specifieke procedure.
Stel vervolgens gerichte vragen waarin termen voorkomen die daadwerkelijk in het document staan. Vraag het model ook om de relevante sectie of het hoofdstuk te noemen en controleer het antwoord handmatig.
Een bruikbare testprompt is bijvoorbeeld:
Welke uitzonderingen noemt hoofdstuk 4 op de aanvraagprocedure? Geef per uitzondering de sectietitel en leg het verschil met de hoofdregel uit.
Zo'n opdracht test zowel het terugvinden van informatie als de verwerking ervan. Dat levert meer informatie op dan een algemene opdracht als "Vat deze pdf samen".
Wanneer wijst de test wél richting hardware?
Een geheugenwaarschuwing bij een hogere contextinstelling is vooral een signaal om eerst een lagere context of een kleiner model te testen.
Controleer daarna of die configuratie nog steeds geschikt is voor je echte werkzaamheden. Een model succesvol kunnen laden is namelijk niet hetzelfde als het model praktisch kunnen gebruiken voor lange gesprekken of omvangrijke documenten.
Ollama biedt daarvoor nog een extra controle. Met ollama ps kun je bekijken waar een geladen model wordt uitgevoerd. Volgens de officiële Ollama-FAQ laat de kolom PROCESSOR zien in welke mate CPU en GPU worden gebruikt.
Gebruik die informatie naast je eigen testresultaten. Als een model niet volledig op de GPU draait, kan dat helpen verklaren waarom de prestaties anders zijn dan verwacht. Het vertelt echter niet automatisch hoeveel sneller een andere videokaart zou zijn.
Koop pas hardware als je weet welke configuratie je nodig hebt
Een inhoudelijk slecht antwoord terwijl voldoende geheugen beschikbaar is, vraagt niet automatisch om een nieuwe GPU. Controleer dan eerst welke passages uit het document zijn gevonden, formuleer een specifiekere vraag of vergelijk de antwoordkwaliteit met een ander model.
Hardware wordt pas een concretere beperking wanneer de combinatie die je daadwerkelijk nodig hebt structureel niet bruikbaar draait.
Noteer daarom minimaal welk model, welke quantisatie, welke contextlengte en welk type documenten je wilt verwerken. Gebruik die gegevens vervolgens bij onze keuzehulp voor een Nvidia-GPU voor lokale AI.
Daarmee verandert de aankoopvraag van "hoeveel VRAM heb ik nodig voor lokale AI?" in een veel nuttigere vraag: welke hardware kan mijn model met mijn benodigde context en documenten bruikbaar draaien?