Alleen voor onze blogbezoekers: ontvang 3 maanden gratis + 10% korting op het driejaarlijkse abonnement YSBLOG10
Grijp de deal

Hoe stel ik een lokale LLM-server in op mijn VPS? (Eenvoudige handleiding)

Laatst bijgewerkt: September 1, 2026 22 min leestijd Sanjeet Chauhan
Stel een lokale LLM-server in op uw VPS.

Een eigen AI-model dat draait op een server die je volledig beheert, is dichterbij dan je denkt. En nee, je hebt geen enorm budget nodig om te beginnen.

Veel mensen denken dat het runnen van een lokale LLM-omgeving dure hardware en een ingewikkelde installatie vereist. 

Dat is niet altijd waar. Met de juiste VPS en de juiste tools kun je je eigen AI-model draaien zonder volledig afhankelijk te zijn van betaalde AI-API's.

Ik heb lokale LLM-servers op VPS-machines opgezet voor mijn eigen projecten en voor klanten. Sommigen wilden meer privacy. Anderen wilden voorkomen dat ze voor elk AI-verzoek dat ze deden moesten betalen.

Voordat deze handleiding werd gemaakt, werd elke belangrijke stap getest op echte servers. 

Dit is dus niet zomaar theorie. Ik zal je het installatieproces laten zien dat daadwerkelijk werkt.

Aan het einde van deze handleiding weet u hoe u een lokale LLM-server op een VPS kunt instellen, van een nieuwe server tot een werkend AI-eindpunt.

Ik houd alles simpel. Je leert elke stap voor stap en ik leg de commando's in eenvoudige bewoordingen uit.

Klaar? Wij zetten je eigen AI-server op.

Wat een lokale LLM-server nu eigenlijk inhoudt

Voordat we commando's uitvoeren, wil ik eerst uitleggen wat we precies aan het bouwen zijn. Als je dat nu begrijpt, wordt de rest van de handleiding een stuk makkelijker.

Een lokale LLM-server is simpelweg een AI-model dat draait op een machine die u beheert. LLM staat voor Large Language Model. Het is de technologie achter AI-tools zoals ChatGPT.

Het woord 'lokaal' betekent hier dat het AI-model op jouw VPS draait in plaats van op de server van iemand anders.

Een VPS ( Virtual Private Server ) is een virtuele machine die je eigen resources biedt op een fysieke server. Je kunt hem gebruiken zoals een computer die altijd met internet verbonden is.

Wanneer je een lokale LLM-server op een VPS draait, plaats je in feite je eigen AI-model op die VPS en laat je het je vragen beantwoorden.

Zie het zo: in plaats van een AI-dienst te gebruiken waarbij iemand anders het model voor je uitvoert, huur je je eigen kleine kantoor en voer je de AI daarin uit.

Dat is het basisidee.

Nu zal ik u laten zien waarom het handig kan zijn om een ​​LLM op uw eigen VPS te draaien.

Waarom zou je een LLM-opleiding op je eigen VPS uitvoeren?

Stel je voor dat je een klantcontract naar een AI-tool stuurt. 

Dat contract wordt nu verwerkt op de servers van iemand anders. Voor veel bedrijven is dat al reden genoeg om zich zorgen te maken over de privacy.

Uiteraard kunt u ook gewoon een AI-service in de cloud gebruiken en verdergaan.

Mijn team stelde dezelfde vraag. Maar na het testen van zelfgehoste LLM's ontdekten we een aantal duidelijke voordelen.

  • Betere privacy: Je prompts en bestanden blijven op je VPS staan. Je hoeft ze niet naar een extern AI-bedrijf te sturen.
  • Lagere kosten bij schaalvergroting: Je betaalt maandelijks voor de VPS in plaats van per AI-aanvraag. Dit kan geld besparen als je veel aanvragen doet.
  • Minder gebruiksbeperkingen: Je bent niet gebonden aan de aanvraaglimieten van een API-provider. Je werkelijke limiet hangt af van de resources van je VPS en het model dat je gebruikt.
  • Meer controle: Je kiest het AI-model, de instellingen en hoe de server werkt. Je hebt de volledige controle over de configuratie.

Deze voordelen zijn vooral nuttig voor teams die met gevoelige informatie werken of dagelijks een groot aantal herinneringen moeten versturen.

Voor die gebruikers kan het heel zinvol zijn om een ​​LLM op hun eigen VPS te draaien.

Let op: Mijn team heeft de in deze handleiding beschreven configuratie getest op een live Ubuntu VPS voordat deze werd gepubliceerd. Ik zal u dezelfde stappen en commando's laten zien die wij hebben gebruikt.

Lokale LLM-server versus cloud-AI in één oogopslag

Twijfel je nog tussen de twee? Laat me de keuze wat makkelijker maken.

Mijn team heeft een lokale LLM-applicatie en een cloudgebaseerde AI-API naast elkaar gezet, zodat u de belangrijkste verschillen kunt zien voordat u een keuze maakt.

Kenmerken Lokale LLM op VPSCloud AI API
PrivacyMeer controle over uw gegevensDe gegevens worden verwerkt door de aanbieder.
KostenVaste VPS-kosten Doorgaans worden de kosten berekend op basis van verbruik.
SnelheidDat hangt af van je VPS en model.Meestal erg snel
GrenzenVoornamelijk beperkt door je eigen server.Er kunnen beperkingen gelden voor de aanbieder.
Controleer:HogeBeperkt tot de mogelijkheden van de aanbieder.

Geen van beide opties is perfect voor iedereen.

Als je meer controle nodig hebt, je AI-workload op je eigen server wilt houden of een groot aantal prompts wilt versturen, is een zelfgehoste LLM wellicht een betere optie.

Wat u nodig heeft voordat u begint

Een goede configuratie begint met de juiste VPS.

Als je dit gedeelte overslaat, installeer je mogelijk alles correct, maar krijg je alsnog een trage AI-server. Laat me daarom even kort uitleggen wat je nodig hebt voordat we commando's uitvoeren.

De juiste VPS-specificaties

Je VPS doet het meeste werk wanneer je een LLM uitvoert. Het model dat je kiest is ook belangrijk, omdat grotere modellen meer resources nodig hebben. RAM en CPU macht.

Er is geen enkele RAM Een formule die voor elk model werkt. De daadwerkelijke vereisten hangen af ​​van het model, de kwantisering, de contextgrootte en andere instellingen.

Voor een eenvoudig uitgangspunt kunt u deze handleiding gebruiken:

ModelgrootteRAM Nodig zijnGoed voor
3B4 GBLichte taken en snelle reacties
7B tot 8B8 GBAlgemeen gebruik en dagelijkse taken
13B16 GBDieper redeneren en programmeren (meer veeleisende taken)
30B en hoger32 GB of meerZware werklasten

Voor de meeste beginners raad ik aan te beginnen met een VPS van 8 GB en minimaal 4 CPU kleuren.

Dat is een goed uitgangspunt voor kleinere 7B- of 8B-modellen. Als u grotere modellen wilt gebruiken of meerdere gebruikers tegelijk wilt bedienen, heeft u meer resources nodig.

Houd er ook rekening mee dat een CPUEen VPS alleen zal veel trager zijn dan een server met een geschikte GPU.

Het besturingssysteem

Vervolgens heb je een schone Linux-installatie nodig.

Ik raad Ubuntu 22.04 LTS of Ubuntu 24.04 LTS aan. LTS staat voor Long Term Support (langetermijnondersteuning). Deze versies ontvangen langdurige beveiligings- en onderhoudsupdates, waardoor ze een goede keuze zijn voor een server.

Je kunt met een paar klikken een Ubuntu VPS aanmaken en je server is binnen enkele minuten klaar voor gebruik.

Zodra Ubuntu is geïnstalleerd, beschik je over de basisserver die we nodig hebben.

Nu heb je een manier nodig om er verbinding mee te maken.

De toegang die u nodig hebt

Je beheert je VPS via SSH.

SSH SSH staat voor Secure Shell. Hiermee kunt u vanaf uw eigen computer veilig verbinding maken met uw server en op afstand opdrachten uitvoeren.

Je hebt normaal gesproken drie dingen nodig:

  • Server-IP-adres: Het openbare IP-adres van uw VPS.
  • gebruikersnaam: Vaak is root-gebruiker nodig op een nieuwe server, hoewel het gebruik van een aparte sudo-gebruiker beter is voor regulier beheer.
  • Wachtwoord of SSH key: Jouw methode om in te loggen op de server. SSH Sleutels zijn over het algemeen veiliger dan wachtwoorden.

Zodra je deze gegevens hebt, kun je verbinding maken met je VPS en beginnen met het installeren van de software.

Voordat we dat doen, is er nog één ding dat je moet begrijpen: hoeveel geheugen je AI-model daadwerkelijk nodig heeft.

Hoe veel RAM en CPU Heb je het echt nodig?

Dit is een van de meest gestelde vragen die ik krijg: Hoeveel? RAM en CPU heb ik eigenlijk nodig?

RAM en CPU Ze doen verschillende dingen, dus het is handig om beide te begrijpen voordat je een VPS kiest.

RAM bepaalt of uw model in het geheugen past. Als uw VPS niet genoeg geheugen heeft. RAMHet model kan mogelijk niet laden of de server kan erg traag worden.

CPU Dit heeft invloed op hoe snel het model antwoorden genereert. Meer CPU Meer vermogen kan helpen, maar de exacte snelheid hangt af van het model, de instellingen en de hardware van je VPS. 

Op een typische CPU-Een VPS van 7B of 8B genereert mogelijk slechts een paar tokens per seconde.

Opslagruimte is ook belangrijk. LLM-modellen kunnen meerdere gigabytes aan schijfruimte in beslag nemen, dus zorg ervoor dat uw VPS voldoende opslagruimte heeft voor de modellen die u wilt gebruiken.

Snelle NVMe SSD-opslag kan ook de laadtijd van modelbestanden verkorten.

Een NVMe SSD VPS is een goede keuze als u snellere opslag en soepelere serverwerking wilt.

Je hebt ook geen grafische kaart nodig om te beginnen. CPU- Alleen VPS-servers kunnen kleinere modellen draaien, hoewel grotere modellen meer resources nodig hebben. RAM en kunnen veel trager reageren.

Mijn advies is simpel: begin klein. Probeer eerst een 3B-, 7B- of 8B-model. Als je meer snelheid nodig hebt of grotere modellen wilt gebruiken, kun je je VPS later upgraden.

Welke modellen kunt u op uw VPS uitvoeren?

Er zijn honderden LLM-programma's beschikbaar, dus het kan lastig zijn om je eerste model te kiezen.

Ik houd de eerste installatie graag eenvoudig. Hier zijn een paar populaire opties om te overwegen:

  • Lama 3.1 8B: Een goed algemeen model voor alledaagse vragen, schrijven en basisprogrammering.
  • Lama 3.2 3B: Een kleiner model dat minder resources nodig heeft en goed werkt op minder krachtige VPS-machines.
  • Mistral 7B: Een lichtgewicht optie voor chatten, schrijven en samenvatten.
  • Qwen 2.5 7B: Een handige keuze als je met meerdere talen werkt of een veelzijdig model zoekt.

DeepSeek-modellen: Sommige DeepSeek-modellen zijn nuttig voor programmeren en redeneren, maar hun resourcevereisten variëren sterk. Controleer het specifieke model voordat u het installeert.

Als je hier nieuw in bent, zou ik niet te veel tijd besteden aan het vergelijken van modellen.

Begin met een kleiner model en kijk hoe het presteert op je VPS. Je kunt later altijd nog een ander model installeren.

Met tools zoals Ollama is het wisselen van modellen eenvoudig. Je kunt een ander model downloaden, testen en het model behouden dat het beste bij je past.

Uw lokale LLM-server stap voor stap instellen

Nu komen we bij het gedeelte waarvoor u gekomen bent.

Ik zal de volledige installatie in eenvoudige stappen uitleggen. Volg ze in de juiste volgorde en je hebt een werkende lokale LLM-server op je VPS.

Je hoeft geen Linux-expert te zijn.

Ik zal je de benodigde commando's geven en uitleggen wat elk commando doet. Kopieer een commando, voer het uit, controleer het resultaat en ga dan verder naar de volgende stap.

Laten we beginnen met het voorbereiden van uw VPS.

Stap 1: Maak verbinding met uw VPS

Laten we beginnen met verbinding te maken met uw VPS.

Open Terminal op je computer. Als je Windows gebruikt, kun je Windows Terminal of PowerShell gebruiken.

Voer deze opdracht uit:

ssh root@your-server-ip

Vervang 'your-server-ip' door het daadwerkelijke IP-adres van uw VPS.

De eerste keer dat u verbinding maakt, ziet u mogelijk een bericht waarin wordt gevraagd of u de server vertrouwt. Typ 'ja' en druk op Enter.

Typ 'ja' en druk op Enter.

Voer vervolgens uw VPS-wachtwoord in.

Zodra je bent ingelogd, bevind je je op je server. Alle commando's die je nu uitvoert, worden uitgevoerd op de VPS, niet op je persoonlijke computer.

Stap 2: Werk uw server bij

Voordat je iets installeert, moet je eerst de pakketten op je VPS bijwerken.

Run:

sudo apt update && sudo apt upgrade -y

Het eerste commando controleert op beschikbare updates. Het tweede installeert ze. De optie -y beantwoordt automatisch met 'ja' wanneer Ubuntu om bevestiging vraagt.

De optie -y geeft automatisch een 'ja'-antwoord wanneer Ubuntu om bevestiging vraagt.

Dit kan een paar minuten duren. Laat het proces voltooien voordat u verdergaat met de volgende stap.

Zodra de updates voltooid zijn, is uw VPS klaar voor gebruik met Ollama.

Stap 3: Installeer Ollama

Nu kunnen we Ollama installeren.

Met Ollama wordt het veel eenvoudiger om LLM's te downloaden en op je eigen server uit te voeren. In plaats van elk model handmatig in te stellen, kun je dat nu doen. manage modellen met eenvoudige commando's.

Run:

curl -fsSL https://ollama.com/install.sh | sh

Het installatieprogramma downloadt Ollama en installeert het op uw Ubuntu-server.

Het installatieprogramma downloadt Ollama en installeert het op uw Ubuntu-server.

Controleer na de installatie of Ollama werkt:

ollama --version

Als het goed is, ziet u een Ollama-versienummer. Zo ja, dan is de installatie gelukt. U kunt de Ollama-service ook controleren met:

sudo systemctl status ollama

Zoek naar een status die aangeeft dat de service actief is.

Stap 4: Download je eerste model

Ollama is nu geïnstalleerd, maar er is nog een model nodig om het te laten werken.

Voor je eerste test raad ik aan te beginnen met een kleiner model dat je VPS zonder problemen aankan.

Bijvoorbeeld:

ollama pull llama3.1:8b

Hiermee wordt het Llama 3.1 8B-model naar uw VPS gedownload. De download kan enkele gigabytes groot zijn, dus maak u geen zorgen als het even duurt. De exacte grootte kan variëren afhankelijk van de modelversie en het formaat.

Als uw VPS beperkte mogelijkheden biedt RAMJe kunt ook beginnen met een kleiner model:

  • ollama pull llama3.2:3b

Je kunt ook andere modellen proberen, zoals:

  • ollama trek mistral
  • ollama pull qwen2.5:7b
ollama trek mistral

Run:

ollama pull llama3.2:3bollama pull mistralollama pull qwen2.5:7b

Het beste model hangt af van wat je ermee wilt doen. 

Kleinere modellen hebben doorgaans minder resources nodig, terwijl grotere modellen betere resultaten kunnen leveren, maar meer resources vergen. RAM en verwerkingskracht.

Stap 5: Voer uw model uit en test het.

Nu komt het leukste gedeelte.

Begin uw model met:

ollama run llama3.1:8b
Hoe stel ik een lokale LLM-server in op mijn VPS? (Eenvoudige handleiding)

Ollama start het model en opent een interactieve chat in je terminal. Typ iets eenvoudigs, zoals:

  • Leg in eenvoudige bewoordingen uit wat een VPS is >> Druk op Enter en wacht op het antwoord >> Het antwoord wordt gegenereerd door het model dat op uw VPS draait.

Als je klaar bent met testen, typ dan >>

/bye

Druk op Enter om de chat te verlaten.

Gefeliciteerd. Je hebt zojuist je eerste lokale LLM-run op je VPS voltooid.

Stap 6: Maak er een API-server van.

De terminal is handig voor testdoeleinden, maar waarschijnlijk wilt u dat uw website, applicatie of andere software met het model communiceert.

Dat is waar een API van pas komt.

Ollama biedt een lokale API die normaal gesproken luistert op poort 11434.

Je kunt het vanaf de VPS testen met:

curl http://localhost:11434/api/generate -d '{"model":"llama3.1:8b","prompt":"Hello","stream":false}'

Als alles naar behoren werkt, zal Ollama een reactie van het model terugsturen.

Ollama zal een reactie van het model terugsturen.

Dat betekent dat uw VPS nu een AI-model draait waarmee andere software kan communiceren.

Houd de API voorlopig alleen toegankelijk vanaf de server zelf. We zullen in een latere stap de veilige toegang op afstand behandelen.

Stap 7: Beveilig uw server

Dit is een van de belangrijkste stappen in de hele installatie. Stel poort 11434 van Ollama niet rechtstreeks bloot aan het openbare internet.

Een publiekelijk toegankelijke Ollama API stelt anderen in staat om verzoeken naar uw server te sturen en uw API te gebruiken. CPU, RAMen bandbreedte.

Eerst, zorg ervoor SSH Als het is toegestaan ​​via je firewall, schakel dan de firewall in.

sudo ufw allow OpenSSHsudo ufw enable

Controleer de status:

sudo ufw status

Je zou moeten zien SSH toegestaan.

Voor persoonlijke toegang, een SSH Een tunnel is een veiligere optie dan poort 11434 voor iedereen open te stellen. Voer dit commando uit op je eigen computer, niet binnen de VPS:

ssh -N -L 11435:127.0.0.1:11434 root@your-server-ip

Houd dat terminalvenster open terwijl u de tunnel gebruikt. Nu wordt poort 11435 van uw computer veilig doorgestuurd naar poort 11434 van Ollama op de VPS.

Je kunt de API vervolgens via de volgende kanalen benaderen:

  • http://127.0.0.1:11435

Deze aanpak zorgt ervoor dat de API van Ollama niet toegankelijk is via het openbare internet.

Belangrijk: Ga er nooit vanuit dat een API veilig is, alleen omdat het model op je eigen VPS draait. Houd de Ollama-poort privé, tenzij je de toegang op afstand goed hebt beveiligd.

Stap 8: Bereik uw server veilig vanaf elke locatie.

An SSH Een tunnel werkt prima als je vanaf je eigen computer toegang tot de server nodig hebt. Maar wat als je wilt dat je website of een andere applicatie met de LLM communiceert?

Dat vereist een andere configuratie.

Je kunt een reverse proxy plaatsen, bijvoorbeeld... Nginx Of Caddy voor Ollama. De proxy kan HTTPS en authenticatie afhandelen, terwijl Ollama erachter beschermd blijft.

De basisopstelling ziet er als volgt uit:

  • Jouw app >> HTTPS >> Reverse proxy >> Ollama >> AI-model

Dit is veel veiliger dan poort 11434 zomaar open te stellen voor het hele internet. 

Je kunt ook een domein gebruiken zoals:

https://ai.sauvik(yourdomain).com

Zie je wel! Je kunt zo'n domein gebruiken in plaats van rechtstreeks verbinding te maken met het IP-adres van de server.

Voor een productieserver raad ik ten zeerste aan om HTTPS, authenticatie, firewallregels en toegangsbeperkingen te gebruiken voordat u andere personen of applicaties toegang geeft tot uw LLM.

Uw lokale LLM-omgeving draait nu. De volgende stap is om de configuratie nuttiger te maken door deze te koppelen aan uw eigen applicaties.

Voeg een eenvoudig chatscherm toe met Open WebUI

Niet iedereen wil via de terminal met een AI praten.

Daarom raad ik vaak aan om Open WebUI toe te voegen. Het geeft je zelfgehoste LLM een eenvoudige chatinterface die vergelijkbaar aanvoelt met ChatGPT.

Je kunt Open WebUI uitvoeren met Docker.

Docker is een tool waarmee applicaties in containers kunnen worden uitgevoerd. Zie een container als een kant-en-klaar pakket dat de software en alles wat nodig is om deze te laten draaien, bevat.

Zorg er allereerst voor dat Docker op je VPS is geïnstalleerd. 

Voer dan uit:

docker run -d -p 3000:8080 \  --add-host=host.docker.internal:host-gateway \  -v open-webui:/app/backend/data \  --name open-webui \  ghcr.io/open-webui/open-webui:main

Zodra de container is gestart, zal Open WebUI op poort 3000 draaien. 

Je kunt het in je browser openen door naar het volgende adres te gaan:

  • http://your-server-ip:3000

Je zou nu het instelscherm van Open WebUI moeten zien >> Maak je account aan >> Verbind Open WebUI met Ollama >> Je hebt dan een eenvoudige webgebaseerde chatinterface voor je lokale AI-model.

Beveiligingstip: Laat poort 3000 niet publiekelijk openstaan ​​zonder na te denken over de beveiliging. Plaats Open WebUI voor gebruik in een productieomgeving achter een reverse proxy met HTTPS en de juiste toegangscontrole.

Een VPS die speciaal voor Docker is gebouwd, kan een goede optie zijn als je van plan bent om Open WebUI, Ollama en andere containers op dezelfde server te draaien.

Waarom YouStable Een VPS is een uitstekende keuze voor een lokale LLM-server.

Mijn team heeft in de loop der jaren met verschillende VPS-providers gewerkt. Voor dit type configuratie geloof ik dat... YouStable Dat kan een praktische optie zijn.

Maar laat ik volkomen transparant zijn.

Let op: YouStable Dit is mijn eigen bedrijf, dus beschouw dit als mijn oprechte mening, niet als een neutrale recensie. Ik heb de argumenten echter wel praktisch en realistisch gehouden.

A YouStable VPS Hiermee krijgt u beheerdersrechten over uw server, zodat u software zoals Ollama, Docker, Open WebUI en andere tools die u mogelijk nodig hebt, kunt installeren.

Hieronder vindt u een aantal functies die van pas kunnen komen bij het uitvoeren van een lokale LLM:

  • Root-toegang: Installeer en configureer de software die u nodig hebt.
  • SSH toegang: Maak veilig verbinding met uw VPS en manage het op afstand.
  • NVMe SSD-opslag: Snellere opslag kan helpen bij het laden van modellen en de algehele serverprestaties verbeteren.
  • Ubuntu-ondersteuning: Zet eenvoudig een Linux-omgeving op voor Ollama en andere AI-tools.
  • Schaalbare bronnen: Upgrade uw serverbronnen als uw werklast toeneemt.

Het belangrijkste is om voldoende te kiezen. RAM en CPU het vermogen dat nodig is voor het model dat u wilt uitvoeren.

Voor een eerste lokaal LLM-project kun je het beste beginnen met een kleiner model en een VPS die binnen je budget past. Je kunt later altijd upgraden als je je werklast beter begrijpt.

Koppel uw LLM aan automatiseringstools.

Een lokaal LLM-systeem wordt veel nuttiger wanneer het taken automatisch kan uitvoeren. 

Automatiseringsplatformen zoals n8n kunnen bijvoorbeeld prompts naar uw Ollama API sturen en de reacties gebruiken in geautomatiseerde workflows.

Je zou workflows kunnen bouwen die:

  • Tekst of documenten samenvatten
  • Categoriseer supporttickets
  • Maak conceptantwoorden aan
  • Verwerk de binnenkomende gegevens.
  • Concepten voor content genereren
  • Stuur AI-gegenereerde resultaten naar andere applicaties.

Het basisidee is eenvoudig:

Activeren >> Gegevens naar uw LLM verzenden >> Een reactie ontvangen >> De volgende actie uitvoeren

Een nieuw supportticket kan bijvoorbeeld een automatiseringsproces in gang zetten. 

De workflow stuurt het ticket naar uw lokale LLM, ontvangt een samenvatting en stuurt die samenvatting vervolgens door naar uw ondersteuningssysteem.

Een VPS voor n8n kan ook handig zijn als je van plan bent om automatiseringsworkflows naast je AI-setup uit te voeren. Dit is waar een lokale LLM meer wordt dan alleen een chatbot.

Het kan onderdeel worden van je dagelijkse werkzaamheden.

Praktische manieren waarop mensen een lokale LLM-server gebruiken

Je vraagt ​​je nu misschien af ​​wat je nu eigenlijk allemaal kunt doen met je nieuwe LLM-server.

Hier zijn enkele veelvoorkomende use cases:

  • Privé chatassistenten: Ontwikkel een interne chatbot voor je team en behoud meer controle over waar je gegevens worden verwerkt.
  • Documentverwerking: Grote hoeveelheden tekst automatisch samenvatten, categoriseren en analyseren.
  • Codeerhulp: Gebruik codeermodellen om code te schrijven, uit te leggen of te beoordelen.
  • Conceptversies van de inhoud: Maak eerste versies van e-mails, artikelen, berichten voor sociale media en andere content.
  • Gegevensclassificatie: Grote tekstcollecties automatisch labelen en ordenen.
  • Automatiseringsworkflows: Koppel uw LLM aan tools die taken automatisch uitvoeren.

Dezelfde LLM-server kan meerdere projecten ondersteunen. Je verbindt eenvoudigweg verschillende applicaties met de API en bouwt workflows rondom het model.

Hoe controleer je of alles werkt?

Voordat u uw lokale LLM voor belangrijk werk gebruikt, voert u eerst een paar snelle controles uit. Controleer allereerst of Ollama uw gedownloade modellen kan zien:

ollama list

Je zou de modellen moeten zien die je eerder hebt geïnstalleerd. 

Test vervolgens je model via de API:

curl http://127.0.0.1:11434/api/generate \  -d '{"model":"llama3.1:8b","prompt":"Hello","stream":false}'

Als je een reactie ontvangt, werkt de Ollama API correct.

Test tot slot de manier waarop u van plan bent toegang te krijgen tot uw server. Als u gebruikmaakt van een SSH Zorg ervoor dat de verbinding door de tunnel heen werkt.

Als je een reverse proxy gebruikt, test dan je domein en HTTPS-verbinding. Zodra alles werkt, is je VPS klaar om echte AI-taken uit te voeren.

Veel voorkomende fouten te vermijden

Ik heb al vaak meegemaakt dat LLM-serverconfiguraties om dezelfde redenen problemen vertoonden. Vermijd deze veelgemaakte fouten en je bespaart jezelf een hoop gedoe met het oplossen van problemen.

Te weinig RAM

Als uw VPS niet over voldoende geheugen beschikt, kan het model mogelijk niet laden of slecht presteren. Controleer altijd de systeemvereisten van het specifieke model dat u wilt gebruiken.

Een model kiezen dat te groot is

Een groot model op een kleine VPS zal tergend traag zijn.

Begin met een kleiner model, test de prestaties en upgrade alleen wanneer dat nodig is.

De havens open laten.

Stel poort 11434 van Ollama nooit rechtstreeks bloot aan het openbare internet, tenzij u de beveiligingsrisico's volledig begrijpt en de juiste beveiligingsmaatregelen hebt getroffen.

Gebruik een SSH tunnel, firewallregels, authenticatie of een correct geconfigureerde reverse proxy.

Systeemupdates overslaan

Werk uw server bij voordat u de software installeert.

Door Ubuntu en je software up-to-date te houden, verlaag je ook de beveiligingsrisico's op de lange termijn.

Het vergeten van back-ups

Je kunt de gedownloade modellen altijd opnieuw downloaden, maar het kan lastiger zijn om je configuratie- en applicatiegegevens opnieuw te genereren.

Maak regelmatig back-ups van belangrijke instellingen, Docker-volumes en applicatiegegevens.

Ervan uitgaand CPU Prestaties die overeenkomen met die van een GPU

A CPUEen VPS met alleen een GPU is een prima manier om te leren en kleinere workloads uit te voeren. Verwacht echter niet dat deze dezelfde prestaties levert als een server met een dedicated GPU.

Grotere modellen en meerdere gebruikers kunnen al snel veel krachtigere hardware vereisen.

Mijn eerlijke mening: 
Het installeren van de basissoftware kan snel gaan. Het kiezen van de juiste VPS, het juiste model, de juiste beveiligingsinstellingen en de juiste toegangsmethode is het onderdeel dat de meeste aandacht verdient. Neem de tijd voor deze beslissingen, en u zult op de lange termijn een veel betrouwbaardere lokale LLM-server hebben.

Veelgestelde vragen

Heb ik een GPU nodig om een ​​lokale LLM-server op een VPS te draaien?

Helemaal niet. Een CPU Alleen VPS-systemen draaien modellen tot en met 14B probleemloos. Een GPU verhoogt de snelheid, maar je kunt ook zonder GPU aan de slag en toch bruikbare antwoorden krijgen.

Hoeveel RAM Heb ik een lokale LLM-opleiding nodig?

Vermenigvuldig de modelgrootte in miljarden met 0.6. Een model van 7 miljard heeft ongeveer 4 tot 5 GB nodig, dus een VPS van 8 GB is voor de meeste mensen voldoende.

Met welk model moet ik beginnen?

Begin met de Llama 3.1 8B. Deze biedt een goede balans tussen kwaliteit en snelheid. Voor lichtere servers zijn de Llama 3.2 3B of Mistral 7B uitstekende instapmodellen.

Is het gebruik van een lokale LLM goedkoper dan het gebruik van een cloud-API?

Ja, op grote schaal. Een vast VPS-tarief is voordeliger dan facturering per aanvraag wanneer je dagelijks veel verzoeken verstuurt. Voor slechts een paar aanvragen kunnen cloud-API's goedkoper zijn.

Kan ik vanuit andere apps toegang krijgen tot mijn lokale LLM-server?

Ja. Ollama draait een OpenAI-compatibele API op poort 11434. De meeste AI-tools kunnen er verbinding mee maken zonder dat er vrijwel iets aan hun instellingen hoeft te worden aangepast.

Hoe houd ik mijn lokale LLM-server veilig?

Gebruik een firewall, houd poort 11434 privé en benader deze via een SSH tunnel. Stel het model nooit rechtstreeks bloot aan het open internet.

Hoe snel zal ik reageren op een VPS?

Op CPU Voor een VPS met 7 bytes kun je rekenen op ongeveer 3 tot 8 woorden per seconde. Prima voor API-aanvragen en batchverwerking, maar iets te traag voor live chat.

Conclusie

We hebben in deze handleiding veel behandeld, dus laten we alles even kort samenvatten.

Je weet nu hoe je een lege VPS kunt omzetten in je eigen werkende AI-server.

We begonnen met uit te leggen wat een lokale LLM-server is en waarom zelfhosting je meer controle kan geven over je AI, data en kosten.

Vervolgens bespraken we de VPS-vereisten en doorliepen we stap voor stap de volledige installatie. Je leerde hoe je verbinding maakt met je server, Ollama installeert, een AI-model downloadt, test en gebruikt via een API.

We hebben ook aandacht besteed aan beveiliging, een eenvoudige chatinterface met Open WebUI toegevoegd en gekeken naar manieren om uw LLM te koppelen aan automatiseringstools.

Het goede nieuws is dat de basisconfiguratie niet zo moeilijk is als het lijkt. Zodra je VPS gereed is, kun je vrij snel een eenvoudige LLM-server in gebruik nemen.

Mijn advies is simpel: begin klein.

Kies een VPS die aan je behoeften voldoet, selecteer een model dat je server aankan en volg de stappen één voor één. Je kunt je server later altijd upgraden of grotere modellen proberen.

Binnenkort zou uw eigen VPS een AI-model kunnen draaien en uw vragen voor u kunnen beantwoorden.

Dus, waar wacht je nog op?

Ga je eigen lokale LLM-server bouwen.

Laat een bericht achter

Je e-mailadres wordt niet gepubliceerd. Verplichte velden zijn gemarkeerd met een *.

Scroll naar boven