[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"reazon-page-\u002Fde\u002Fwissen\u002Fazure-openai-bedrock-alternative-schweiz":3,"reazon-mainnav":38,"reazon-angebot-subnav":48,"reazon-articles-\u002Fde\u002Fwissen":49,"reazon-offering-angebot-zielgruppen":175,"reazon-offering-angebot-leistungen":176,"reazon-footernav":189},{"data":4},{"id":5,"path":6,"slug":7,"published_at":8,"page_type":9,"no_index":12,"fields":13,"blocks":37},1488,"\u002Fde\u002Fwissen\u002Fazure-openai-bedrock-alternative-schweiz","azure-openai-bedrock-alternative-schweiz","2026-07-13T09:41:31.318Z",{"identifier":10,"name":11},"article","Blog Post",false,{"title":14,"summary":15,"meta_title":16,"meta_description":17,"big5_category":18,"publication_date":19,"primary_service":20,"hubs":27,"body":35,"body_html":36},"Souveräne Inferenz gegen Azure OpenAI und AWS Bedrock: was sich im Alltag ändert","Azure OpenAI und AWS Bedrock gegen einen souverän betriebenen Endpoint: warum der Schweizer Serverstandort der Hyperscaler das Kernproblem nicht löst und was der Unterschied im Betrieb bedeutet.","Azure OpenAI & AWS Bedrock: die souveräne Alternative | Twentyone","Azure OpenAI und AWS Bedrock sind bequem, aber unterliegen dem CLOUD Act, auch im Schweizer Rechenzentrum. Was eine souveräne Alternative konkret anders macht.","comparisons","2026-07-13T00:00:00Z",{"id":21,"slug":22,"path":23,"page_type":24,"published":25,"type":26},676,"managed-inference","\u002Fde\u002Fmanaged-inference","service",true,"Cms::Page",[28],{"hub":29},{"id":21,"slug":22,"path":23,"page_type":24,"published":25,"fields":30,"type":26},{"title":31,"summary":32,"meta_description":33,"meta_title":34},"Managed Inference","LLM-Endpoints via vLLM — von uns betrieben, ohne Ops-Aufwand, mit Schweizer Datenhoheit.","Gemanagte LLM-Endpoints (vLLM) statt eigener Ops: OpenAI-kompatible API, Schweizer Datenhoheit, DSG-\u002FDSGVO-konform. Kosten, Vergleich zu Self-Host und API.","Managed LLM Inference — vLLM-Endpoints aus der Schweiz | Twentyone","## Der Vergleich, den die Anbieterseiten meiden\n\nAzure OpenAI und AWS Bedrock sind die bequemsten Wege zu einem grossen Sprachmodell: ein Konto, ein API-Schlüssel, in Minuten läuft der erste Request. Was auf den Produktseiten fehlt, ist der Vergleich mit einem souverän betriebenen Endpoint. Nicht, weil er unfair wäre, sondern weil er an einer Stelle heikel wird, an der die Hyperscaler wenig anzubieten haben: der Rechtsordnung über deinen Daten.\n\n## Was Azure OpenAI und Bedrock gut können\n\nFangen wir mit dem an, was für sie spricht. Beide sind gemanagt, skalieren praktisch beliebig und sind tief in ihr jeweiliges Cloud-Ökosystem integriert. Bedrock bringt einen breiten Katalog verschiedener Modelle unter ein API, Azure OpenAI liefert die bekannten Modelle mit dem Betrieb von Microsoft dahinter. Wer ohnehin in Azure oder AWS zu Hause ist und mit unkritischen Daten arbeitet, bekommt hier einen schnellen, stabilen Weg. Das ist ein echtes Argument, und wir tun nicht so, als wäre es keins.\n\n## Wo der Schweizer Serverstandort nicht genügt\n\nBeide bieten inzwischen Rechenzentren in der Schweiz an, und genau hier entsteht das Missverständnis. Der Standort der Festplatte löst das rechtliche Problem nicht. Microsoft und Amazon sind US-Konzerne und unterliegen dem CLOUD Act, der auf das Unternehmen zugreift, unabhängig davon, in welchem Land der Server steht. Deine Daten können in Zürich liegen und trotzdem im Zugriff einer fremden Behörde sein. Datenhoheit entscheidet sich am Betreiber und seiner Rechtsordnung, nicht an der Geografie, wie der Beitrag [Was Datenhoheit konkret heisst](\u002Fde\u002Fwissen\u002Fdatenhoheit-was-bedeutet-das) im Detail zeigt.\n\n## Drei Unterschiede im Alltag\n\n**Rechtsraum.** Ein souveräner Endpoint läuft bei einem Betreiber, der nur Schweizer Recht untersteht. Kein fremder Konzern im Hintergrund, kein CLOUD Act.\n\n**Modell.** Bei den Hyperscalern bist du an deren Modelle gebunden, und wenn eines abgekündigt oder verändert wird, richtest du dich danach. Ein offenes Modell gehört in dem Sinn dir: Du kannst es festhalten, umziehen und selbst versionieren.\n\n**Rechnung.** Die Hyperscaler rechnen pro Token oder pro Nutzung ab, die Rechnung schwankt mit dem Traffic. Ein reservierter Endpoint kostet eine feste Monatspauschale, planbar statt nach Verbrauch.\n\n## Wann welcher Weg gewinnt\n\nEs gibt keinen Grund, das schön ausbalanciert zu lassen. Steckst du tief in einem Cloud-Ökosystem und sind deine Daten nicht reguliert, ist der Hyperscaler ein vernünftiger Weg. Sobald aber regulierte Daten, planbare Kosten oder echte Unabhängigkeit vom Anbieter zählen, löst die Bequemlichkeit das eigentliche Problem nicht, und dann gewinnt der souveräne Endpoint. Für Schweizer Daten mit rechtlicher Bindung ist das eher die Regel als die Ausnahme.\n\n## Der Umstieg ist kleiner als gedacht\n\nDer häufigste Einwand lautet, ein Wechsel sei aufwendig. Weil souveräne Endpoints in der Regel OpenAI-kompatibel sind, ist der Umstieg zu weiten Teilen eine Sache der Konfiguration, nicht des Neubaus. Wo die echten Tücken liegen, steht im Beitrag [Von der OpenAI-API zu souveräner Inferenz](\u002Fde\u002Fwissen\u002Fopenai-api-migration). Willst du wissen, wie dein Fall auf einem [souveränen Endpoint](\u002Fde\u002Fmanaged-inference) aussähe? Beschreib uns Modell und Last, wir rechnen es dir vor: [Kontakt](\u002Fde\u002Fkontakt).","\u003Ch2>Der Vergleich, den die Anbieterseiten meiden\u003C\u002Fh2>\n\n\u003Cp>Azure OpenAI und AWS Bedrock sind die bequemsten Wege zu einem grossen Sprachmodell: ein Konto, ein API-Schlüssel, in Minuten läuft der erste Request. Was auf den Produktseiten fehlt, ist der Vergleich mit einem souverän betriebenen Endpoint. Nicht, weil er unfair wäre, sondern weil er an einer Stelle heikel wird, an der die Hyperscaler wenig anzubieten haben: der Rechtsordnung über deinen Daten.\u003C\u002Fp>\n\n\u003Ch2>Was Azure OpenAI und Bedrock gut können\u003C\u002Fh2>\n\n\u003Cp>Fangen wir mit dem an, was für sie spricht. Beide sind gemanagt, skalieren praktisch beliebig und sind tief in ihr jeweiliges Cloud-Ökosystem integriert. Bedrock bringt einen breiten Katalog verschiedener Modelle unter ein API, Azure OpenAI liefert die bekannten Modelle mit dem Betrieb von Microsoft dahinter. Wer ohnehin in Azure oder AWS zu Hause ist und mit unkritischen Daten arbeitet, bekommt hier einen schnellen, stabilen Weg. Das ist ein echtes Argument, und wir tun nicht so, als wäre es keins.\u003C\u002Fp>\n\n\u003Ch2>Wo der Schweizer Serverstandort nicht genügt\u003C\u002Fh2>\n\n\u003Cp>Beide bieten inzwischen Rechenzentren in der Schweiz an, und genau hier entsteht das Missverständnis. Der Standort der Festplatte löst das rechtliche Problem nicht. Microsoft und Amazon sind US-Konzerne und unterliegen dem CLOUD Act, der auf das Unternehmen zugreift, unabhängig davon, in welchem Land der Server steht. Deine Daten können in Zürich liegen und trotzdem im Zugriff einer fremden Behörde sein. Datenhoheit entscheidet sich am Betreiber und seiner Rechtsordnung, nicht an der Geografie, wie der Beitrag \u003Ca href=\"\u002Fde\u002Fwissen\u002Fdatenhoheit-was-bedeutet-das\">Was Datenhoheit konkret heisst\u003C\u002Fa> im Detail zeigt.\u003C\u002Fp>\n\n\u003Ch2>Drei Unterschiede im Alltag\u003C\u002Fh2>\n\n\u003Cp>\u003Cstrong>Rechtsraum.\u003C\u002Fstrong> Ein souveräner Endpoint läuft bei einem Betreiber, der nur Schweizer Recht untersteht. Kein fremder Konzern im Hintergrund, kein CLOUD Act.\u003C\u002Fp>\n\n\u003Cp>\u003Cstrong>Modell.\u003C\u002Fstrong> Bei den Hyperscalern bist du an deren Modelle gebunden, und wenn eines abgekündigt oder verändert wird, richtest du dich danach. Ein offenes Modell gehört in dem Sinn dir: Du kannst es festhalten, umziehen und selbst versionieren.\u003C\u002Fp>\n\n\u003Cp>\u003Cstrong>Rechnung.\u003C\u002Fstrong> Die Hyperscaler rechnen pro Token oder pro Nutzung ab, die Rechnung schwankt mit dem Traffic. Ein reservierter Endpoint kostet eine feste Monatspauschale, planbar statt nach Verbrauch.\u003C\u002Fp>\n\n\u003Ch2>Wann welcher Weg gewinnt\u003C\u002Fh2>\n\n\u003Cp>Es gibt keinen Grund, das schön ausbalanciert zu lassen. Steckst du tief in einem Cloud-Ökosystem und sind deine Daten nicht reguliert, ist der Hyperscaler ein vernünftiger Weg. Sobald aber regulierte Daten, planbare Kosten oder echte Unabhängigkeit vom Anbieter zählen, löst die Bequemlichkeit das eigentliche Problem nicht, und dann gewinnt der souveräne Endpoint. Für Schweizer Daten mit rechtlicher Bindung ist das eher die Regel als die Ausnahme.\u003C\u002Fp>\n\n\u003Ch2>Der Umstieg ist kleiner als gedacht\u003C\u002Fh2>\n\n\u003Cp>Der häufigste Einwand lautet, ein Wechsel sei aufwendig. Weil souveräne Endpoints in der Regel OpenAI-kompatibel sind, ist der Umstieg zu weiten Teilen eine Sache der Konfiguration, nicht des Neubaus. Wo die echten Tücken liegen, steht im Beitrag \u003Ca href=\"\u002Fde\u002Fwissen\u002Fopenai-api-migration\">Von der OpenAI-API zu souveräner Inferenz\u003C\u002Fa>. Willst du wissen, wie dein Fall auf einem \u003Ca href=\"\u002Fde\u002Fmanaged-inference\">souveränen Endpoint\u003C\u002Fa> aussähe? Beschreib uns Modell und Last, wir rechnen es dir vor: \u003Ca href=\"\u002Fde\u002Fkontakt\">Kontakt\u003C\u002Fa>.\u003C\u002Fp>\n",[],[39,42,45],{"title":40,"href":41},"Preise","\u002Fde\u002Fpreise",{"title":43,"href":44},"Wissen","\u002Fde\u002Fwissen",{"title":46,"href":47},"Über Twentyone","\u002Fde\u002Fueber-uns",[],[50,54,67,77,85,93,100,107,113,119,125,132,138,144,150,156,162,169],{"path":6,"slug":7,"title":14,"summary":15,"image":51,"publication_date":19,"big5_category":18,"primary_hub":51,"cluster":51,"pillar":51,"hubs":52},null,[53],{"slug":22,"title":31},{"path":55,"slug":56,"title":57,"summary":58,"image":51,"publication_date":19,"big5_category":59,"primary_hub":51,"cluster":51,"pillar":51,"hubs":60},"\u002Fde\u002Fwissen\u002Fbeste-gpu-llm-inferenz","beste-gpu-llm-inferenz","Die beste GPU für LLM-Inferenz: DGX Spark, H100, L40S und RTX im Vergleich","Welche GPU für eigene Inferenz? DGX Spark, H100, L40S und RTX 4090 nach dem, was zählt: wie viel Modell hineinpasst, wie viel Durchsatz herauskommt und was der Monat kostet.","bestof",[61,64],{"slug":62,"title":63},"bare-metal","Bare Metal GPU mit Root-Zugriff",{"slug":65,"title":66},"dgx-spark","DGX Spark mieten",{"path":68,"slug":69,"title":70,"summary":71,"image":51,"publication_date":19,"big5_category":72,"primary_hub":51,"cluster":51,"pillar":51,"hubs":73},"\u002Fde\u002Fwissen\u002Fhermes-agent-erfahrungsbericht","hermes-agent-erfahrungsbericht","Hermes-Agent im Realbetrieb: was ein souveräner Agent wirklich leistet","Ein Erfahrungsbericht statt Hochglanzprospekt: wie sich ein souverän betriebener Hermes-Agent im täglichen Einsatz verhält, wo er glänzt und wo die Begleitung anfängt.","reviews",[74],{"slug":75,"title":76},"agents","Hermes Agents as a Service",{"path":78,"slug":79,"title":80,"summary":81,"image":51,"publication_date":19,"big5_category":82,"primary_hub":51,"cluster":51,"pillar":51,"hubs":83},"\u002Fde\u002Fwissen\u002Fki-regulierte-daten-schweiz","ki-regulierte-daten-schweiz","KI mit regulierten Daten: LLMs nutzen, ohne dass die Daten die Schweiz verlassen","Für Branchen, in denen Daten das Land nicht verlassen dürfen: was revDSG, Berufsgeheimnis und der CLOUD Act für KI-Projekte bedeuten, und wie souveräne Inferenz den Rahmen einhält.","problems",[84],{"slug":22,"title":31},{"path":86,"slug":87,"title":88,"summary":89,"image":51,"publication_date":19,"big5_category":90,"primary_hub":51,"cluster":51,"pillar":51,"hubs":91},"\u002Fde\u002Fwissen\u002Fopenai-api-kosten-vs-eigener-endpoint","openai-api-kosten-vs-eigener-endpoint","Ab welchem Volumen sich ein eigener Endpoint gegen die API rechnet","Die Pay-per-Token-API ist günstig, bis sie es nicht mehr ist. Wo genau der Break-even zu einem reservierten Endpoint mit fester Monatspauschale liegt, an einem konkreten Beispiel durchgerechnet.","cost",[92],{"slug":22,"title":31},{"path":94,"slug":95,"title":96,"summary":97,"image":51,"publication_date":98,"big5_category":18,"primary_hub":51,"cluster":51,"pillar":51,"hubs":99},"\u002Fde\u002Fwissen\u002Ffine-tuning-rag-prompt","fine-tuning-rag-prompt","Fine-Tuning, RAG oder besserer Prompt? Die klare Entscheidungsregel","Fine-Tuning ist meistens nicht die Antwort auf „das Modell kennt unsere Daten nicht“. Wann Prompting, RAG oder Fine-Tuning wirklich das richtige Werkzeug sind und wie du die Eskalationsleiter korrekt durchläufst.","2026-07-07T00:00:00Z",[],{"path":101,"slug":102,"title":103,"summary":104,"image":51,"publication_date":98,"big5_category":105,"primary_hub":51,"cluster":51,"pillar":51,"hubs":106},"\u002Fde\u002Fwissen\u002Fopenai-api-migration","openai-api-migration","Von der OpenAI-API zu souveräner Inferenz: die Migration in der Praxis","Der Umstieg von OpenAI oder Anthropic auf ein selbst betriebenes offenes Modell in der Schweiz sieht dank OpenAI-kompatibler Endpoints nach einer Ein-Zeilen-Änderung aus, ist aber doch mehr. Wo Prompts, Tool-Calling und Feature-Lücken zur Stolperfalle werden.","how-to",[],{"path":108,"slug":109,"title":110,"summary":111,"image":51,"publication_date":98,"big5_category":82,"primary_hub":51,"cluster":51,"pillar":51,"hubs":112},"\u002Fde\u002Fwissen\u002Fquantisierung-int4-int8-awq-gptq-gguf","quantisierung-int4-int8-awq-gptq-gguf","Quantisierung ohne Qualitätsverlust: int4, int8, AWQ, GPTQ, GGUF entzaubert","int8 ist fast immer verlustfrei, int4 meistens auch, aber nicht bei Reasoning, Code und langen Agenten-Ketten. Wir zeigen dir ungeschönt, was Quantisierung wirklich kostet und wo GPTQ, AWQ, GGUF und bitsandbytes hingehören.",[],{"path":114,"slug":115,"title":116,"summary":117,"image":51,"publication_date":98,"big5_category":82,"primary_hub":51,"cluster":51,"pillar":51,"hubs":118},"\u002Fde\u002Fwissen\u002Frag-schlechte-antworten","rag-schlechte-antworten","RAG richtig gebaut: warum eure Wissensbasis schlechte Antworten gibt","Die meisten RAG-Systeme scheitern nicht am Sprachmodell, sondern am Retrieval davor. Wir zeigen die häufigsten Fehlerquellen bei Chunking, Embeddings und Retrieval-Strategie sowie, wie du Retrieval- und Generationsfehler sauber auseinanderhältst.",[],{"path":120,"slug":121,"title":122,"summary":123,"image":51,"publication_date":98,"big5_category":105,"primary_hub":51,"cluster":51,"pillar":51,"hubs":124},"\u002Fde\u002Fwissen\u002Fvram-modell-gpu-berechnen","vram-modell-gpu-berechnen","Welches Modell passt auf welche GPU? VRAM richtig berechnen","Bevor du GPUs kaufst oder mietest: die Faustformel für Gewichte, KV-Cache und Overhead, damit du weisst, welches Modell wirklich auf deine Hardware passt.",[],{"path":126,"slug":127,"title":128,"summary":129,"image":51,"publication_date":130,"big5_category":82,"primary_hub":51,"cluster":51,"pillar":51,"hubs":131},"\u002Fde\u002Fwissen\u002Fagent-oder-endpoint","agent-oder-endpoint","Braucht ihr wirklich einen Agent oder reicht ein Endpoint?","Agenten sind im Trend, aber oft die teurere und fragilere Lösung für ein Problem, das ein einfacher Endpoint löst. Wann sich der Aufwand lohnt und wann nicht.","2026-06-30T00:00:00Z",[],{"path":133,"slug":134,"title":135,"summary":136,"image":51,"publication_date":130,"big5_category":82,"primary_hub":51,"cluster":51,"pillar":51,"hubs":137},"\u002Fde\u002Fwissen\u002Fdatenhoheit-was-bedeutet-das","datenhoheit-was-bedeutet-das","Was Datenhoheit konkret heisst und wo deine Prompts wirklich landen","Datenhoheit ist mehr als ein Hosting-Standort. Was rechtlich, technisch und vertraglich dahintersteckt, und welche Fragen du jedem AI-Anbieter stellen solltest.",[],{"path":139,"slug":140,"title":141,"summary":142,"image":51,"publication_date":130,"big5_category":72,"primary_hub":51,"cluster":51,"pillar":51,"hubs":143},"\u002Fde\u002Fwissen\u002Fdgx-spark-erfahrungsbericht","dgx-spark-erfahrungsbericht","DGX Spark im Betrieb: was die Maschine nach drei Monaten wirklich kann","Kein Datenblatt, sondern ein Erfahrungsbericht. Wo die DGX Spark im täglichen Betrieb glänzt, wo ihre Grenzen liegen und für wen sich die Maschine lohnt.",[],{"path":145,"slug":146,"title":147,"summary":148,"image":51,"publication_date":130,"big5_category":105,"primary_hub":51,"cluster":51,"pillar":51,"hubs":149},"\u002Fde\u002Fwissen\u002Fllm-endpoint-aufsetzen","llm-endpoint-aufsetzen","Eigenen LLM Endpoint aufsetzen: von der GPU zum ersten Token","Ein realistischer Weg vom blanken Server zum produktiven Inferenz-Endpoint. Die Schritte, die Reihenfolge und die Stolpersteine, die zwischen „läuft lokal“ und „läuft produktiv“ liegen.",[],{"path":151,"slug":152,"title":153,"summary":154,"image":51,"publication_date":130,"big5_category":59,"primary_hub":51,"cluster":51,"pillar":51,"hubs":155},"\u002Fde\u002Fwissen\u002Foffene-modelle-auswahl","offene-modelle-auswahl","Welches offene Modell für welche Aufgabe? Llama, Qwen, Mistral & Co.","Nicht das grösste Modell gewinnt, sondern das passende. Wie du offene Modelle nach Aufgabe, Speicherbedarf und Lizenz auswählst, statt Benchmarks hinterherzulaufen.",[],{"path":157,"slug":158,"title":159,"summary":160,"image":51,"publication_date":130,"big5_category":18,"primary_hub":51,"cluster":51,"pillar":51,"hubs":161},"\u002Fde\u002Fwissen\u002Fvllm-ollama-tgi-vergleich","vllm-ollama-tgi-vergleich","vLLM, Ollama oder TGI: welche Inference Engine für welchen Fall","Die Engine entscheidet über Durchsatz, Latenz und Betriebsaufwand. Ein nüchterner Vergleich der drei verbreitetsten Optionen, inklusive der Fälle, in denen die einfache Lösung gewinnt.",[],{"path":163,"slug":164,"title":165,"summary":166,"image":51,"publication_date":167,"big5_category":18,"primary_hub":51,"cluster":51,"pillar":51,"hubs":168},"\u002Fde\u002Fwissen\u002Fdgx-spark-vs-cloud-gpu","dgx-spark-vs-cloud-gpu","DGX Spark gegen Cloud-GPU: wann sich eigene Hardware lohnt","Unified Memory gegen rohen Durchsatz, Schweizer Hardware gegen Hyperscaler. Ein nüchterner Vergleich, inklusive der Fälle, in denen die Cloud gewinnt.","2026-06-18T00:00:00Z",[],{"path":170,"slug":171,"title":172,"summary":173,"image":51,"publication_date":167,"big5_category":90,"primary_hub":51,"cluster":51,"pillar":51,"hubs":174},"\u002Fde\u002Fwissen\u002Fllm-selbst-betreiben-kosten","llm-selbst-betreiben-kosten","Was kostet es, ein LLM selbst zu betreiben?","Die nüchterne Rechnung hinter eigenen LLM-Endpoints: Hardware, Betrieb und der Punkt, ab dem sich Selbermachen wirklich lohnt.",[],[],[177,180,184,185],{"title":66,"href":178,"description":179},"\u002Fde\u002Fdgx-spark","Der NVIDIA-AI-Supercomputer für den Schreibtisch — on-demand aus der Schweiz, bare metal oder gemanagt.",{"title":181,"href":182,"description":183},"Bare Metal GPU","\u002Fde\u002Fbare-metal","DGX Spark & H100 als dedizierte Maschine — volle Kontrolle, Root-Zugriff, Schweizer Rechenzentrum.",{"title":31,"href":23,"description":32},{"title":186,"href":187,"description":188},"Hermes Agents","\u002Fde\u002Fagents","Agentische Workloads gemanagt — Hermes-Agents auf souveräner Hardware, von uns betrieben.",[190,197],{"title":191,"links":192},"Leistungen",[193,194,195,196],{"title":66,"href":178},{"title":181,"href":182},{"title":31,"href":23},{"title":186,"href":187},{"title":198,"links":199},"Unternehmen",[200,201,202,203],{"title":46,"href":47},{"title":43,"href":44},{"title":40,"href":41},{"title":204,"href":205},"Kontakt","\u002Fde\u002Fkontakt"]