Google Research heeft
Diffusion Controller toegelicht, een methode om AI-beeldgeneratoren nauwkeuriger te laten reageren op opdrachten. Een extra neuraal netwerk stuurt de beeldopbouw bij, terwijl het basismodel ongewijzigd kan blijven. De onderzoekers richten zich op betere aansluiting bij gebruikerswensen zonder de beeldkwaliteit te verliezen.
De publicatie is een nieuwe uitleg van eerder onderzoek. De bijbehorende
wetenschappelijke paper verscheen al op 7 maart 2026. Google kondigt met het blog geen direct beschikbare functie voor Gemini of Nano Banana aan.
Hoe stuurt Diffusion Controller een afbeelding bij?
Diffusiemodellen bouwen een afbeelding stapsgewijs op uit ruis. Diffusion Controller kijkt tijdens dat proces mee en berekent kleine correcties. Een rem op al te grote afwijkingen moet voorkomen dat het model een gevraagd detail toevoegt ten koste van de rest van het beeld.
Google illustreert het probleem met een hagedis die een zonnebril moet dragen. Een generator kan de bril vergeten, of het dier vervormen wanneer hij die te nadrukkelijk probeert toe te voegen. De controller probeert beide eisen tegelijk te bewaken: het juiste detail en een geloofwaardige afbeelding.
Het aanpassen van modellen met kleine toevoegingen heeft een langere geschiedenis. Bij
LoRA, voluit Low-Rank Adaptation, blijven de oorspronkelijke modelgewichten eveneens vaststaan. Ontwikkelaars voegen trainbare onderdelen toe aan bestaande lagen. Zo hoeven zij veel minder parameters, de instelbare waarden van het netwerk, te trainen dan bij het opnieuw afstellen van een volledig model. De oorspronkelijke LoRA-paper onderzocht dit voor taalmodellen.
Een andere bestaande route is het versterken van de invloed van een opdracht tijdens het genereren. Het onderzoek naar
classifier-free guidance van Jonathan Ho en Tim Salimans beschrijft hoe voorspellingen met en zonder de opgegeven voorwaarde worden gecombineerd. De gekozen menging beïnvloedt de verhouding tussen beeldkwaliteit en variatie. Daarmee is bijsturen meer dan simpelweg een langere prompt invoeren: ook de manier waarop een model zijn voorspellingen combineert, bepaalt het resultaat.
Wat bewijzen de gepresenteerde tests?
De experimenten gebruikten Stable Diffusion 1.4. In de paper scoort de controller bij training met gewogen beloningen een winstpercentage van 68,15 procent tegenover het oorspronkelijke model, tegen 61,09 procent voor LoRA. Bij een andere trainingsmethode haalt de gezamenlijk getrainde variant 93,53 procent; LoRA bereikt daar 90,48 procent.
De veelgenoemde score boven 90 procent geldt dus voor een variant waarbij ook het basismodel kan worden aangepast. Bovendien gaat het om voorkeursscores tegenover de oorspronkelijke generator, niet om het percentage opdrachten dat foutloos wordt uitgevoerd. De resultaten vormen geen rechtstreekse vergelijking met de nieuwste commerciële beeldmodellen.
De gebruikte
Human Preference Score v2 is zelf een AI-model dat menselijke voorkeuren probeert te voorspellen. Het is getraind met een dataset van ongeveer 798.000 voorkeursoordelen over 430.000
afbeeldingen. De benchmark omvat animatie, conceptkunst, schilderijen en fotografie. Volgens de makers zijn vergelijkingen alleen betekenisvol bij afbeeldingen die met dezelfde prompt zijn gemaakt.
Die meetmethode maakt grote vergelijkingen uitvoerbaar, maar geeft geen universeel oordeel over creativiteit. Een hoge voorspelde voorkeursscore vertelt bijvoorbeeld niet of een beeld past binnen de huisstijl van een opdrachtgever. Dat onderscheid sluit aan bij de eerder beschreven discussie over
beeldgeneratoren die technisch verbeteren maar op elkaar blijven lijken.
Wat kunnen ontwikkelaars hiermee, en wat nog niet?
De methode vraagt nog steeds technische toegang tot het generatieproces. De paper spreekt van ‘gray-box’: het basismodel kan afgesloten blijven, maar moet tussenresultaten beschikbaar stellen, zoals voorspellingen tijdens het verwijderen van ruis. Alleen toegang tot een dienst die een prompt ontvangt en een eindafbeelding terugstuurt, volstaat daarvoor niet.
Dat maakt de aanpak vooral relevant voor partijen die een beeldmodel aanbieden of hun eigen infrastructuur beheren. Zij kunnen onderzoeken of een afzonderlijke stuurlaag gemakkelijker is te onderhouden dan meerdere aangepaste modellen. Of dat in de praktijk goedkoper of sneller uitpakt, moet per toepassing worden gemeten. De gepresenteerde scores leveren daarvoor nog geen algemene besparingspercentages.
Voor gewone gebruikers verandert er voorlopig geen instelling in een beeldapp. AI Wereld beschreef eerder de concrete beschikbaarheid van
Nano Banana 2 in Googles producten. Bij Diffusion Controller gaat het om een onderzoeksmethode waarvan toepassing in die producten niet is aangekondigd.
Google noemt personalisatie, bescherming tegen schadelijke beelden en videomodellen als mogelijke vervolgrichtingen. De belangrijkste praktijktest wordt of zulke sturing ook betrouwbaar werkt bij nieuwe modellen en veeleisende opdrachten. Voor een ontwerper telt uiteindelijk hoeveel bruikbare beelden de techniek oplevert, inclusief de tijd die nodig blijft voor selectie en correctie.