Self-Hosted Large Language Model (LLM) z Ollama za serwerem proxy z autoryzacją
Techniczny przewodnik krok po kroku po wdrożeniu prywatnego serwera LLM z akceleracją GPU (Ollama) zabezpieczonego przez serwer proxy Nginx z autoryzacją.
4 artykułów w tej kategorii
Śledź tę kategorię przez RSSTechniczny przewodnik krok po kroku po wdrożeniu prywatnego serwera LLM z akceleracją GPU (Ollama) zabezpieczonego przez serwer proxy Nginx z autoryzacją.
Rozmiar chunku bywa wybrany raz i nigdy nie podważany, bo podważanie wygląda na wymagające pełnej oceny. Wymaga trzydziestu pytań, jednej miary i przebiegu obywającego się bez jednego wywołania modelu językowego.
Każda odpowiedź API podaje dokładnie, ile tokenów kosztowała, w podziale na cztery klasy. Zapisywanie tej liczby zamiast jej szacowania to dwadzieścia linii – i jedyna podstawa, na której budżet może być czymś więcej niż ostrzeżeniem.
Cztery nazwy robotów rozstrzygają, czy witryna zostanie odczytana na potrzeby trenowania modeli. Wymienienie ich kosztuje po jednej linijce – ale plik odpowiadający błędem pozwala na wszystko, a jeden z tych czterech nie robi tego, co mu się przypisuje.