Self-Hosted Large Language Model (LLM) mit Ollama hinter einem Auth-Proxy
Eine technische Anleitung zur Bereitstellung eines privaten, GPU-beschleunigten LLM-Servers mit Ollama hinter einem sicheren Nginx-Authentifizierungs-Proxy.
4 Artikel in dieser Kategorie
Diese Rubrik per RSS verfolgenEine technische Anleitung zur Bereitstellung eines privaten, GPU-beschleunigten LLM-Servers mit Ollama hinter einem sicheren Nginx-Authentifizierungs-Proxy.
Die Chunk-Größe wird meist einmal gewählt und nie hinterfragt, weil Hinterfragen nach einer vollen Bewertung aussieht. Nötig sind dreißig Fragen, eine Kennzahl und ein Durchlauf, der ohne einen einzigen Aufruf eines Sprachmodells auskommt.
Jede API-Antwort nennt genau, wie viele Token sie gekostet hat, aufgeteilt in vier Klassen. Diese Zahl mitzuschreiben statt sie zu schätzen, kostet zwanzig Zeilen – und ist die einzige Grundlage, auf der ein Budget mehr sein kann als eine Warnung.
Vier Crawler-Namen entscheiden, ob eine Seite für KI-Training gelesen wird. Sie zu nennen kostet je eine Zeile – aber eine Datei, die mit einem Fehler antwortet, erlaubt alles, und einer der vier tut nicht das, was ihm nachgesagt wird.