[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"reazon-offering-angebot-leistungen":3,"reazon-offering-angebot-zielgruppen":20,"reazon-angebot-subnav":21,"reazon-mainnav":22,"reazon-page-\u002Fde\u002Fmanaged-inference":32,"reazon-footernav":197,"reazon-articles-\u002Fde\u002Fwissen":213},[4,8,12,16],{"title":5,"href":6,"description":7},"DGX Spark mieten","\u002Fde\u002Fdgx-spark","Der NVIDIA-AI-Supercomputer für den Schreibtisch — on-demand aus der Schweiz, bare metal oder gemanagt.",{"title":9,"href":10,"description":11},"Bare Metal GPU","\u002Fde\u002Fbare-metal","DGX Spark & H100 als dedizierte Maschine — volle Kontrolle, Root-Zugriff, Schweizer Rechenzentrum.",{"title":13,"href":14,"description":15},"Managed Inference","\u002Fde\u002Fmanaged-inference","LLM-Endpoints via vLLM — von uns betrieben, ohne Ops-Aufwand, mit Schweizer Datenhoheit.",{"title":17,"href":18,"description":19},"Hermes Agents","\u002Fde\u002Fagents","Agentische Workloads gemanagt — Hermes-Agents auf souveräner Hardware, von uns betrieben.",[],[],[23,26,29],{"title":24,"href":25},"Preise","\u002Fde\u002Fpreise",{"title":27,"href":28},"Wissen","\u002Fde\u002Fwissen",{"title":30,"href":31},"Über Twentyone","\u002Fde\u002Fueber-uns",{"data":33},{"id":34,"path":14,"slug":35,"published_at":36,"page_type":37,"no_index":40,"fields":41,"blocks":44},676,"managed-inference","2026-06-19T09:21:42.146Z",{"identifier":38,"name":39},"service","Service-Hub",false,{"title":13,"summary":15,"meta_description":42,"meta_title":43},"Gemanagte LLM-Endpoints (vLLM) statt eigener Ops: OpenAI-kompatible API, Schweizer Datenhoheit, DSG-\u002FDSGVO-konform. Kosten, Vergleich zu Self-Host und API.","Managed LLM Inference — vLLM-Endpoints aus der Schweiz | Twentyone",[45,72,86,98,110,122,134,154,181],{"id":46,"position":47,"content_type":48,"fields":51},8096,1,{"identifier":49,"name":50},"cluster_grid","Themen-Grid",{"headline":52,"subnav_label":53,"subnav_anchor":54,"items":55},"Managed Inference im Überblick","Überblick","ueberblick",[56,60,64,68],{"title":57,"description":58,"description_html":59},"OpenAI-kompatible API","Du sprichst denselben Endpoint an wie bei den grossen Anbietern. Bestehender Code läuft oft ohne Änderung.","\u003Cp>Du sprichst denselben Endpoint an wie bei den grossen Anbietern. Bestehender Code läuft oft ohne Änderung.\u003C\u002Fp>\n",{"title":61,"description":62,"description_html":63},"vLLM unter der Haube","Hoher Durchsatz, effizientes Batching, offene Modelle deiner Wahl. Wir halten die Engine aktuell.","\u003Cp>Hoher Durchsatz, effizientes Batching, offene Modelle deiner Wahl. Wir halten die Engine aktuell.\u003C\u002Fp>\n",{"title":65,"description":66,"description_html":67},"Kein Ops-Aufwand","Skalierung, Updates, Monitoring und Neustarts laufen bei uns. Du bekommst eine URL und einen Key.","\u003Cp>Skalierung, Updates, Monitoring und Neustarts laufen bei uns. Du bekommst eine URL und einen Key.\u003C\u002Fp>\n",{"title":69,"description":70,"description_html":71},"Schweizer Datenhoheit","Prompts und Antworten bleiben in der Schweiz. DSG- und DSGVO-konform, ohne Zusatzaufwand.","\u003Cp>Prompts und Antworten bleiben in der Schweiz. DSG- und DSGVO-konform, ohne Zusatzaufwand.\u003C\u002Fp>\n",{"id":73,"position":74,"content_type":75,"fields":78},8097,2,{"identifier":76,"name":77},"big5_section","TAYA-Sektion",{"pillar":79,"eyebrow":80,"headline":81,"subnav_label":82,"subnav_anchor":83,"body":84,"body_html":85},"cost","Was kostet das?","Was Managed Inference kostet","Kosten","kosten","Du zahlst für einen laufenden Endpoint im Monatsmodell, nicht für eine ganze Maschine, die du selbst auslasten musst. Das macht die Kosten planbar.\n\nWas den Preis bestimmt: die Modellgrösse und wie viel Kapazität du reservierst. Ein kleines Modell für gelegentliche Anfragen kostet deutlich weniger als ein grosses unter Dauerlast. Die Ansätze stehen auf der [Preisseite](\u002Fde\u002Fpreise).\n\nGegenüber einer kommerziellen API zahlst du keinen Aufschlag pro Token an einen US-Anbieter, sondern eine klare Schweizer Rechnung.","\u003Cp>Du zahlst für einen laufenden Endpoint im Monatsmodell, nicht für eine ganze Maschine, die du selbst auslasten musst. Das macht die Kosten planbar.\u003C\u002Fp>\n\n\u003Cp>Was den Preis bestimmt: die Modellgrösse und wie viel Kapazität du reservierst. Ein kleines Modell für gelegentliche Anfragen kostet deutlich weniger als ein grosses unter Dauerlast. Die Ansätze stehen auf der \u003Ca href=\"\u002Fde\u002Fpreise\">Preisseite\u003C\u002Fa>.\u003C\u002Fp>\n\n\u003Cp>Gegenüber einer kommerziellen API zahlst du keinen Aufschlag pro Token an einen US-Anbieter, sondern eine klare Schweizer Rechnung.\u003C\u002Fp>\n",{"id":87,"position":88,"content_type":89,"fields":90},8098,3,{"identifier":76,"name":77},{"pillar":91,"eyebrow":92,"headline":93,"subnav_label":94,"subnav_anchor":95,"body":96,"body_html":97},"problems","Passt das zu mir?","Wann gemanagt besser ist als selbst betreiben","Wann sinnvoll","wann-sinnvoll","Managed Inference passt, wenn das Modell ein Baustein in deinem Produkt ist und nicht dein Kerngeschäft. Du willst eine stabile API, keine GPU, die du nachts neu startest.\n\nEs passt nicht, wenn du tief in den Stack eingreifen musst: eigene CUDA-Kernel, exotische Modellarchitekturen, Training. Dafür nimmst du [Bare Metal](\u002Fde\u002Fbare-metal) mit Root.\n\nViele starten gemanagt und behalten es. Den Betrieb selbst zu übernehmen lohnt sich erst, wenn Last und Anforderungen es wirklich verlangen.","\u003Cp>Managed Inference passt, wenn das Modell ein Baustein in deinem Produkt ist und nicht dein Kerngeschäft. Du willst eine stabile API, keine GPU, die du nachts neu startest.\u003C\u002Fp>\n\n\u003Cp>Es passt nicht, wenn du tief in den Stack eingreifen musst: eigene CUDA-Kernel, exotische Modellarchitekturen, Training. Dafür nimmst du \u003Ca href=\"\u002Fde\u002Fbare-metal\">Bare Metal\u003C\u002Fa> mit Root.\u003C\u002Fp>\n\n\u003Cp>Viele starten gemanagt und behalten es. Den Betrieb selbst zu übernehmen lohnt sich erst, wenn Last und Anforderungen es wirklich verlangen.\u003C\u002Fp>\n",{"id":99,"position":100,"content_type":101,"fields":102},8099,4,{"identifier":76,"name":77},{"pillar":103,"eyebrow":104,"headline":105,"subnav_label":106,"subnav_anchor":107,"body":108,"body_html":109},"comparisons","Wie unterscheidet sich das?","Managed Inference, Self-Host oder kommerzielle API","Vergleich","vergleich","**Kommerzielle API** (OpenAI und Co.) ist sofort da, aber deine Daten gehen zu einem US-Anbieter, und du bist an dessen Modelle und Preise gebunden.\n\n**Self-Host** gibt dir volle Kontrolle, kostet dich aber den ganzen Betrieb: Treiber, Skalierung, Updates, Bereitschaft.\n\n**Managed Inference bei twentyone** liegt dazwischen: OpenAI-kompatibel und ohne Ops wie die API, aber mit offenen Modellen und Schweizer Datenhoheit wie beim Self-Host. Du behältst die Wahl des Modells, ohne den Betrieb zu erben.","\u003Cp>\u003Cstrong>Kommerzielle API\u003C\u002Fstrong> (OpenAI und Co.) ist sofort da, aber deine Daten gehen zu einem US-Anbieter, und du bist an dessen Modelle und Preise gebunden.\u003C\u002Fp>\n\n\u003Cp>\u003Cstrong>Self-Host\u003C\u002Fstrong> gibt dir volle Kontrolle, kostet dich aber den ganzen Betrieb: Treiber, Skalierung, Updates, Bereitschaft.\u003C\u002Fp>\n\n\u003Cp>\u003Cstrong>Managed Inference bei twentyone\u003C\u002Fstrong> liegt dazwischen: OpenAI-kompatibel und ohne Ops wie die API, aber mit offenen Modellen und Schweizer Datenhoheit wie beim Self-Host. Du behältst die Wahl des Modells, ohne den Betrieb zu erben.\u003C\u002Fp>\n",{"id":111,"position":112,"content_type":113,"fields":114},8100,5,{"identifier":76,"name":77},{"subnav_anchor":115,"pillar":116,"eyebrow":117,"headline":118,"subnav_label":119,"body":120,"body_html":121},"beispiele","reviews","Habt ihr Beispiele?","Wir betreiben unsere eigenen Endpoints","Beispiele","Die Endpoints, die unsere eigenen Produkte und Agents versorgen, laufen auf demselben Setup, das du mietest. vLLM, offene Modelle, Schweizer Hardware.\n\nWir wissen, wie sich die Engine unter Dauerlast verhält und wo sie getunt werden muss, weil wir sie selbst im Betrieb haben.","\u003Cp>Die Endpoints, die unsere eigenen Produkte und Agents versorgen, laufen auf demselben Setup, das du mietest. vLLM, offene Modelle, Schweizer Hardware.\u003C\u002Fp>\n\n\u003Cp>Wir wissen, wie sich die Engine unter Dauerlast verhält und wo sie getunt werden muss, weil wir sie selbst im Betrieb haben.\u003C\u002Fp>\n",{"id":123,"position":124,"content_type":125,"fields":126},8101,6,{"identifier":76,"name":77},{"pillar":127,"eyebrow":128,"headline":129,"subnav_label":130,"subnav_anchor":131,"body":132,"body_html":133},"bestof","Was empfehlt ihr?","So holst du das Beste aus einem Endpoint","Empfehlung","empfehlung","Wähle das kleinste Modell, das deine Aufgabe löst. Grösser ist nicht automatisch besser, nur teurer und langsamer.\n\nNutze die OpenAI-kompatible Schnittstelle, dann bleibst du flexibel und kannst Modelle wechseln, ohne deinen Code umzuschreiben.\n\nMiss echte Last, bevor du Kapazität reservierst. Wir helfen dir beim Sizing, statt dir vorsorglich das grösste Paket zu verkaufen.","\u003Cp>Wähle das kleinste Modell, das deine Aufgabe löst. Grösser ist nicht automatisch besser, nur teurer und langsamer.\u003C\u002Fp>\n\n\u003Cp>Nutze die OpenAI-kompatible Schnittstelle, dann bleibst du flexibel und kannst Modelle wechseln, ohne deinen Code umzuschreiben.\u003C\u002Fp>\n\n\u003Cp>Miss echte Last, bevor du Kapazität reservierst. Wir helfen dir beim Sizing, statt dir vorsorglich das grösste Paket zu verkaufen.\u003C\u002Fp>\n",{"id":135,"position":136,"content_type":137,"fields":140},8102,7,{"identifier":138,"name":139},"pricing_teaser","Preis-Teaser",{"eyebrow":24,"headline":141,"body":142,"body_html":143,"cta":144},"Monatsmodell statt Token-Lotterie","Du zahlst für reservierte Kapazität im Monat, planbar und ohne Überraschung. Die Ansätze stehen offen auf der Preisseite.","\u003Cp>Du zahlst für reservierte Kapazität im Monat, planbar und ohne Überraschung. Die Ansätze stehen offen auf der Preisseite.\u003C\u002Fp>\n",{"type":145,"label":146,"target":147,"page":148,"url":25},"internal","Preise ansehen",null,{"id":149,"slug":150,"path":25,"page_type":151,"published":152,"type":153},678,"preise","page",true,"Cms::Page",{"id":155,"position":156,"content_type":157,"fields":160},8103,8,{"identifier":158,"name":159},"faq_list","FAQ-Liste",{"headline":161,"subnav_label":162,"subnav_anchor":163,"items":164},"Häufige Fragen zu Managed Inference","FAQs","faqs",[165,169,173,177],{"question":166,"answer":167,"answer_html":168},"Ist die API wirklich OpenAI-kompatibel?","Ja. Du änderst Base-URL und Key, der Rest deines Codes bleibt meist gleich.","\u003Cp>Ja. Du änderst Base-URL und Key, der Rest deines Codes bleibt meist gleich.\u003C\u002Fp>\n",{"question":170,"answer":171,"answer_html":172},"Welche Modelle kann ich nutzen?","Offene Modelle deiner Wahl. Sag uns, welches du brauchst, wir stellen es bereit oder beraten dich zur Alternative.","\u003Cp>Offene Modelle deiner Wahl. Sag uns, welches du brauchst, wir stellen es bereit oder beraten dich zur Alternative.\u003C\u002Fp>\n",{"question":174,"answer":175,"answer_html":176},"Wo werden meine Prompts verarbeitet?","Auf unserer Hardware in der Schweiz. Es geht nichts an einen Drittanbieter ausserhalb der Schweiz.","\u003Cp>Auf unserer Hardware in der Schweiz. Es geht nichts an einen Drittanbieter ausserhalb der Schweiz.\u003C\u002Fp>\n",{"question":178,"answer":179,"answer_html":180},"Was, wenn ich später mehr Kontrolle brauche?","Dann wechselst du auf [Bare Metal](\u002Fde\u002Fbare-metal) mit Root. Derselbe Anbieter, dieselbe Hardware-Basis.","\u003Cp>Dann wechselst du auf \u003Ca href=\"\u002Fde\u002Fbare-metal\">Bare Metal\u003C\u002Fa> mit Root. Derselbe Anbieter, dieselbe Hardware-Basis.\u003C\u002Fp>\n",{"id":182,"position":183,"content_type":184,"fields":187},8104,9,{"identifier":185,"name":186},"cta","CTA Block",{"headline":188,"subline":189,"cta":190,"mode":196},"Ein Endpoint, den du nicht betreiben musst","Sag uns, welches Modell du brauchst und mit welcher Last. Wir richten den Endpoint ein.",{"type":145,"label":191,"target":147,"page":192,"url":195},"Kontakt aufnehmen",{"id":193,"slug":194,"path":195,"page_type":151,"published":152,"type":153},682,"kontakt","\u002Fde\u002Fkontakt","dark",[198,205],{"title":199,"links":200},"Leistungen",[201,202,203,204],{"title":5,"href":6},{"title":9,"href":10},{"title":13,"href":14},{"title":17,"href":18},{"title":206,"links":207},"Unternehmen",[208,209,210,211],{"title":30,"href":31},{"title":27,"href":28},{"title":24,"href":25},{"title":212,"href":195},"Kontakt",[214,222,233,242,249,256,263,270,276,282,288,295,301,307,313,319,325,332],{"path":215,"slug":216,"title":217,"summary":218,"image":147,"publication_date":219,"big5_category":103,"hubs":220},"\u002Fde\u002Fwissen\u002Fazure-openai-bedrock-alternative-schweiz","azure-openai-bedrock-alternative-schweiz","Souveräne Inferenz gegen Azure OpenAI und AWS Bedrock: was sich im Alltag ändert","Azure OpenAI und AWS Bedrock gegen einen souverän betriebenen Endpoint: warum der Schweizer Serverstandort der Hyperscaler das Kernproblem nicht löst und was der Unterschied im Betrieb bedeutet.","2026-07-13T00:00:00Z",[221],{"slug":35,"title":13},{"path":223,"slug":224,"title":225,"summary":226,"image":147,"publication_date":219,"big5_category":127,"hubs":227},"\u002Fde\u002Fwissen\u002Fbeste-gpu-llm-inferenz","beste-gpu-llm-inferenz","Die beste GPU für LLM-Inferenz: DGX Spark, H100, L40S und RTX im Vergleich","Welche GPU für eigene Inferenz? DGX Spark, H100, L40S und RTX 4090 nach dem, was zählt: wie viel Modell hineinpasst, wie viel Durchsatz herauskommt und was der Monat kostet.",[228,231],{"slug":229,"title":230},"bare-metal","Bare Metal GPU mit Root-Zugriff",{"slug":232,"title":5},"dgx-spark",{"path":234,"slug":235,"title":236,"summary":237,"image":147,"publication_date":219,"big5_category":116,"hubs":238},"\u002Fde\u002Fwissen\u002Fhermes-agent-erfahrungsbericht","hermes-agent-erfahrungsbericht","Hermes-Agent im Realbetrieb: was ein souveräner Agent wirklich leistet","Ein Erfahrungsbericht statt Hochglanzprospekt: wie sich ein souverän betriebener Hermes-Agent im täglichen Einsatz verhält, wo er glänzt und wo die Begleitung anfängt.",[239],{"slug":240,"title":241},"agents","Hermes Agents as a Service",{"path":243,"slug":244,"title":245,"summary":246,"image":147,"publication_date":219,"big5_category":91,"hubs":247},"\u002Fde\u002Fwissen\u002Fki-regulierte-daten-schweiz","ki-regulierte-daten-schweiz","KI mit regulierten Daten: LLMs nutzen, ohne dass die Daten die Schweiz verlassen","Für Branchen, in denen Daten das Land nicht verlassen dürfen: was revDSG, Berufsgeheimnis und der CLOUD Act für KI-Projekte bedeuten, und wie souveräne Inferenz den Rahmen einhält.",[248],{"slug":35,"title":13},{"path":250,"slug":251,"title":252,"summary":253,"image":147,"publication_date":219,"big5_category":79,"hubs":254},"\u002Fde\u002Fwissen\u002Fopenai-api-kosten-vs-eigener-endpoint","openai-api-kosten-vs-eigener-endpoint","Ab welchem Volumen sich ein eigener Endpoint gegen die API rechnet","Die Pay-per-Token-API ist günstig, bis sie es nicht mehr ist. Wo genau der Break-even zu einem reservierten Endpoint mit fester Monatspauschale liegt, an einem konkreten Beispiel durchgerechnet.",[255],{"slug":35,"title":13},{"path":257,"slug":258,"title":259,"summary":260,"image":147,"publication_date":261,"big5_category":103,"hubs":262},"\u002Fde\u002Fwissen\u002Ffine-tuning-rag-prompt","fine-tuning-rag-prompt","Fine-Tuning, RAG oder besserer Prompt? Die klare Entscheidungsregel","Fine-Tuning ist meistens nicht die Antwort auf „das Modell kennt unsere Daten nicht“. Wann Prompting, RAG oder Fine-Tuning wirklich das richtige Werkzeug sind und wie du die Eskalationsleiter korrekt durchläufst.","2026-07-07T00:00:00Z",[],{"path":264,"slug":265,"title":266,"summary":267,"image":147,"publication_date":261,"big5_category":268,"hubs":269},"\u002Fde\u002Fwissen\u002Fopenai-api-migration","openai-api-migration","Von der OpenAI-API zu souveräner Inferenz: die Migration in der Praxis","Der Umstieg von OpenAI oder Anthropic auf ein selbst betriebenes offenes Modell in der Schweiz sieht dank OpenAI-kompatibler Endpoints nach einer Ein-Zeilen-Änderung aus, ist aber doch mehr. Wo Prompts, Tool-Calling und Feature-Lücken zur Stolperfalle werden.","how-to",[],{"path":271,"slug":272,"title":273,"summary":274,"image":147,"publication_date":261,"big5_category":91,"hubs":275},"\u002Fde\u002Fwissen\u002Fquantisierung-int4-int8-awq-gptq-gguf","quantisierung-int4-int8-awq-gptq-gguf","Quantisierung ohne Qualitätsverlust: int4, int8, AWQ, GPTQ, GGUF entzaubert","int8 ist fast immer verlustfrei, int4 meistens auch, aber nicht bei Reasoning, Code und langen Agenten-Ketten. Wir zeigen dir ungeschönt, was Quantisierung wirklich kostet und wo GPTQ, AWQ, GGUF und bitsandbytes hingehören.",[],{"path":277,"slug":278,"title":279,"summary":280,"image":147,"publication_date":261,"big5_category":91,"hubs":281},"\u002Fde\u002Fwissen\u002Frag-schlechte-antworten","rag-schlechte-antworten","RAG richtig gebaut: warum eure Wissensbasis schlechte Antworten gibt","Die meisten RAG-Systeme scheitern nicht am Sprachmodell, sondern am Retrieval davor. Wir zeigen die häufigsten Fehlerquellen bei Chunking, Embeddings und Retrieval-Strategie sowie, wie du Retrieval- und Generationsfehler sauber auseinanderhältst.",[],{"path":283,"slug":284,"title":285,"summary":286,"image":147,"publication_date":261,"big5_category":268,"hubs":287},"\u002Fde\u002Fwissen\u002Fvram-modell-gpu-berechnen","vram-modell-gpu-berechnen","Welches Modell passt auf welche GPU? VRAM richtig berechnen","Bevor du GPUs kaufst oder mietest: die Faustformel für Gewichte, KV-Cache und Overhead, damit du weisst, welches Modell wirklich auf deine Hardware passt.",[],{"path":289,"slug":290,"title":291,"summary":292,"image":147,"publication_date":293,"big5_category":91,"hubs":294},"\u002Fde\u002Fwissen\u002Fagent-oder-endpoint","agent-oder-endpoint","Braucht ihr wirklich einen Agent oder reicht ein Endpoint?","Agenten sind im Trend, aber oft die teurere und fragilere Lösung für ein Problem, das ein einfacher Endpoint löst. Wann sich der Aufwand lohnt und wann nicht.","2026-06-30T00:00:00Z",[],{"path":296,"slug":297,"title":298,"summary":299,"image":147,"publication_date":293,"big5_category":91,"hubs":300},"\u002Fde\u002Fwissen\u002Fdatenhoheit-was-bedeutet-das","datenhoheit-was-bedeutet-das","Was Datenhoheit konkret heisst und wo deine Prompts wirklich landen","Datenhoheit ist mehr als ein Hosting-Standort. Was rechtlich, technisch und vertraglich dahintersteckt, und welche Fragen du jedem AI-Anbieter stellen solltest.",[],{"path":302,"slug":303,"title":304,"summary":305,"image":147,"publication_date":293,"big5_category":116,"hubs":306},"\u002Fde\u002Fwissen\u002Fdgx-spark-erfahrungsbericht","dgx-spark-erfahrungsbericht","DGX Spark im Betrieb: was die Maschine nach drei Monaten wirklich kann","Kein Datenblatt, sondern ein Erfahrungsbericht. Wo die DGX Spark im täglichen Betrieb glänzt, wo ihre Grenzen liegen und für wen sich die Maschine lohnt.",[],{"path":308,"slug":309,"title":310,"summary":311,"image":147,"publication_date":293,"big5_category":268,"hubs":312},"\u002Fde\u002Fwissen\u002Fllm-endpoint-aufsetzen","llm-endpoint-aufsetzen","Eigenen LLM Endpoint aufsetzen: von der GPU zum ersten Token","Ein realistischer Weg vom blanken Server zum produktiven Inferenz-Endpoint. Die Schritte, die Reihenfolge und die Stolpersteine, die zwischen „läuft lokal“ und „läuft produktiv“ liegen.",[],{"path":314,"slug":315,"title":316,"summary":317,"image":147,"publication_date":293,"big5_category":127,"hubs":318},"\u002Fde\u002Fwissen\u002Foffene-modelle-auswahl","offene-modelle-auswahl","Welches offene Modell für welche Aufgabe? Llama, Qwen, Mistral & Co.","Nicht das grösste Modell gewinnt, sondern das passende. Wie du offene Modelle nach Aufgabe, Speicherbedarf und Lizenz auswählst, statt Benchmarks hinterherzulaufen.",[],{"path":320,"slug":321,"title":322,"summary":323,"image":147,"publication_date":293,"big5_category":103,"hubs":324},"\u002Fde\u002Fwissen\u002Fvllm-ollama-tgi-vergleich","vllm-ollama-tgi-vergleich","vLLM, Ollama oder TGI: welche Inference Engine für welchen Fall","Die Engine entscheidet über Durchsatz, Latenz und Betriebsaufwand. Ein nüchterner Vergleich der drei verbreitetsten Optionen, inklusive der Fälle, in denen die einfache Lösung gewinnt.",[],{"path":326,"slug":327,"title":328,"summary":329,"image":147,"publication_date":330,"big5_category":103,"hubs":331},"\u002Fde\u002Fwissen\u002Fdgx-spark-vs-cloud-gpu","dgx-spark-vs-cloud-gpu","DGX Spark gegen Cloud-GPU: wann sich eigene Hardware lohnt","Unified Memory gegen rohen Durchsatz, Schweizer Hardware gegen Hyperscaler. Ein nüchterner Vergleich, inklusive der Fälle, in denen die Cloud gewinnt.","2026-06-18T00:00:00Z",[],{"path":333,"slug":334,"title":335,"summary":336,"image":147,"publication_date":330,"big5_category":79,"hubs":337},"\u002Fde\u002Fwissen\u002Fllm-selbst-betreiben-kosten","llm-selbst-betreiben-kosten","Was kostet es, ein LLM selbst zu betreiben?","Die nüchterne Rechnung hinter eigenen LLM-Endpoints: Hardware, Betrieb und der Punkt, ab dem sich Selbermachen wirklich lohnt.",[]]