Mein neues Buch
Souveräne KI
Strategie und Aufbau der eigenen Open-Source-Infrastruktur
Eigene LLMs betreiben, unabhängig von der Cloud. Von der Hardware bis zum laufenden System.
Jetzt bei Amazon bestellenRoboter-Autos mit dem ESP32
Bauen, programmieren, steuern
Vom ersten Chassis bis zur WLAN-Steuerung. Schritt für Schritt zum eigenen Roboter-Auto.
Jetzt bei Amazon bestellenBuch und E-Book, Rheinwerk Verlag
Werbung / Affiliate-Link
Latest Posts
- Warum ich mir einen digitalen Begleiter selbst baue
Der Auslöser war eine einfache Frage. Welche KI-Assistenten gibt es eigentlich, die älteren Menschen den Tag strukturieren, für Ansprache sorgen und den Kontakt zur Familie halten? Die Antwort hat mich überrascht. Der Markt kann und bietet bereits erstaunlich viel. Er kann nur eines nicht, meine Lebensgeschichte gehört nur mir allein und ausgerechnet das ist der… Weiterlesen: Warum ich mir einen digitalen Begleiter selbst baue - Firecrawl mit vLLM betreiben: Zwei Modelle hinter einer Base-URL
Mein Firecrawl-Stack lief bisher gegen einen Ollama-Server. Das war bequem, denn Ollama liefert Chat-Modell und Embedding-Modell unter einer einzigen Adresse aus. Seit ich meine zwei RTX A6000 auf vLLM umgestellt habe, ist dieser Komfort weg. Und genau daran bin ich beim ersten Versuch gescheitert. Das Problem klingt banal, ist aber hartnäckig: vLLM serviert pro Instanz… Weiterlesen: Firecrawl mit vLLM betreiben: Zwei Modelle hinter einer Base-URL - NVIDIA DGX Spark: Qwen3.8-27B mit SGLang und Docker Compose aufsetzen
Nach meiner vLLM-Serie auf dem Dual-A6000-Server wollte ich wissen, wie sich Qwen3.8-27B auf der NVIDIA DGX Spark schlägt. Mein Ziel: ein lokales Modell als Backend für OpenCode, mit dem ich ESP32-Firmware schreiben, bauen und flashen lasse. Der Plan war zunächst vLLM. Am Ende ist es SGLang geworden. Warum, und wie die Installation Schritt für Schritt… Weiterlesen: NVIDIA DGX Spark: Qwen3.8-27B mit SGLang und Docker Compose aufsetzen - Qwen3.8-27B auf zwei RTX A6000: BF16, INT4 und MTP im llama-benchy-Vergleich
In diesem Beitrag vLLM auf zwei RTX A6000 installieren: Treiber, Setup und erster Start mit Qwen3.8-27B habe ich vLLM auf zwei RTX A6000 eingerichtet und drei Varianten von Qwen3.8-27B heruntergeladen. Volles BF16, eine INT4-Quantisierung und eine INT4-Variante mit MTP für Speculative Decoding. Nach einem Kommentar auf LinkedIn kam noch eine vierte dazu, eine GPTQ-INT4-Variante, die… Weiterlesen: Qwen3.8-27B auf zwei RTX A6000: BF16, INT4 und MTP im llama-benchy-Vergleich - vLLM optimieren: Quantisierung, Multi-GPU-Troubleshooting und Agentenbetrieb mit Qwen3.8-27B
Im ersten Teil habe ich vLLM auf meinen zwei RTX A6000 installiert und Qwen3.8-27B im vollen BF16 zum Laufen gebracht. Das funktionierte, aber im Alltag hat mich das Ergebnis nicht überzeugt. Beide Karten waren permanent belegt, nur um ein einziges Modell über Tensor Parallel zu bedienen, und beim agentischen Coden mit OpenCode fühlte sich das… Weiterlesen: vLLM optimieren: Quantisierung, Multi-GPU-Troubleshooting und Agentenbetrieb mit Qwen3.8-27B


Ein toller Guide der leicht zugänglich und verständlich ist. Perfekt für ein kleines Side-Project geeignet. Aktuell half mir noch mein…
Thank you for this great tutorial, could you share n8n workflow and comfyui workflow please?
Hallo Anton, die Meldung besagt das in meinem Beisiel Methoden verwendet werden die veraltet (deprecated) sind. Also müsstest Du die…
Danke für das Tool! Ich habe erst kürzlich angefangen mich mit der Thematik zu beschäftigen und bin für meine Erwartungen…
Hallo, ich habe ihre Anleitung befolgt und bekomme im letzten Schritt leider immer folgende Meldung im Terminal: bash <(wget -qO-…