[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"reazon-page-\u002Fde\u002Fwissen\u002Fki-regulierte-daten-schweiz":3,"reazon-angebot-subnav":38,"reazon-mainnav":39,"reazon-offering-angebot-leistungen":49,"reazon-offering-angebot-zielgruppen":63,"reazon-footernav":64,"reazon-articles-\u002Fde\u002Fwissen":81},{"data":4},{"id":5,"path":6,"slug":7,"published_at":8,"page_type":9,"no_index":12,"fields":13,"blocks":37},1486,"\u002Fde\u002Fwissen\u002Fki-regulierte-daten-schweiz","ki-regulierte-daten-schweiz","2026-07-13T09:40:59.864Z",{"identifier":10,"name":11},"article","Blog Post",false,{"title":14,"summary":15,"meta_title":16,"meta_description":17,"big5_category":18,"publication_date":19,"primary_service":20,"hubs":27,"body":35,"body_html":36},"KI mit regulierten Daten: LLMs nutzen, ohne dass die Daten die Schweiz verlassen","Für Branchen, in denen Daten das Land nicht verlassen dürfen: was revDSG, Berufsgeheimnis und der CLOUD Act für KI-Projekte bedeuten, und wie souveräne Inferenz den Rahmen einhält.","KI mit regulierten Daten in der Schweiz nutzen | Twentyone","Gesundheit, Finanz, Recht, öffentliche Hand: wie sich LLMs einsetzen lassen, ohne Berufsgeheimnis, revDSG und CLOUD-Act-Risiko zu verletzen. Der praktische Weg.","problems","2026-07-13T00:00:00Z",{"id":21,"slug":22,"path":23,"page_type":24,"published":25,"type":26},676,"managed-inference","\u002Fde\u002Fmanaged-inference","service",true,"Cms::Page",[28],{"hub":29},{"id":21,"slug":22,"path":23,"page_type":24,"published":25,"fields":30,"type":26},{"title":31,"summary":32,"meta_description":33,"meta_title":34},"Managed Inference","LLM-Endpoints via vLLM — von uns betrieben, ohne Ops-Aufwand, mit Schweizer Datenhoheit.","Gemanagte LLM-Endpoints (vLLM) statt eigener Ops: OpenAI-kompatible API, Schweizer Datenhoheit, DSG-\u002FDSGVO-konform. Kosten, Vergleich zu Self-Host und API.","Managed LLM Inference — vLLM-Endpoints aus der Schweiz | Twentyone","## Wo „in der Cloud“ zur Rechtsfrage wird\n\nFür die meisten Unternehmen ist der Serverstandort eine Präferenz. Für regulierte Branchen ist er eine Grenze, die das Gesetz zieht. Wer mit Patientendaten, Bankkundendaten, Mandatsakten oder Verwaltungsdaten arbeitet, kann nicht einfach den nächstbesten KI-Dienst anbinden. Ein Prompt, der solche Daten enthält und an eine fremde API geht, kann schon der Vorgang sein, der eine Pflicht verletzt, bevor überhaupt eine Antwort zurückkommt.\n\n## Vier Bereiche, ein gemeinsames Problem\n\n**Gesundheit.** Patientendaten fallen unter das Berufsgeheimnis nach Art. 321 StGB. Sie an einen Dritten weiterzugeben, der keiner Schweigepflicht untersteht, ist strafbewehrt, und ein US-Cloud-Anbieter ist ein solcher Dritter.\n\n**Finanz.** Bankkundendaten sind besonders geschützt, und die FINMA stellt klare Anforderungen an das Outsourcing wesentlicher Funktionen. Wer Kundendaten durch ein fremdes Modell schickt, muss belegen können, wer darauf zugreift.\n\n**Recht.** Das Anwaltsgeheimnis deckt die gesamte Mandatsbeziehung. Eine Kanzlei, die Schriftsätze von einer Cloud-KI zusammenfassen lässt, gibt genau die Daten heraus, die sie schützen muss.\n\n**Öffentliche Hand.** Amtsgeheimnis und kantonale Datenschutzgesetze binden Verwaltungen oft enger als die Privatwirtschaft, gerade bei Personendaten der Bürger.\n\nSo verschieden die Branchen sind, das Problem ist dasselbe: Die Daten dürfen den kontrollierten Rechtsraum nicht verlassen.\n\n## Warum der Serverstandort allein nicht reicht\n\nHier liegt der Denkfehler, den viele Anbieter stehen lassen. Ein Rechenzentrum in der Schweiz klingt nach Lösung, ist aber nur die halbe. Gehört der Anbieter zu einem US-Konzern, unterliegt er dem CLOUD Act, und der greift auf das Unternehmen zu, nicht auf den Standort der Festplatte. Die Daten können physisch in Zürich liegen und rechtlich trotzdem im Zugriff einer fremden Behörde sein. Datenhoheit ist eine Frage der Rechtsordnung über den Betreiber, nicht nur der Geografie. Was das im Detail bedeutet, steht im Beitrag [Was Datenhoheit konkret heisst](\u002Fde\u002Fwissen\u002Fdatenhoheit-was-bedeutet-das).\n\n## Was ein belastbares Setup ausmacht\n\nEin Setup, das dem Rahmen standhält, hat vier Merkmale. Es läuft auf offenen Modellen, damit keine Daten zum Training eines fremden Anbieters abfliessen. Es läuft auf Hardware in der Schweiz, betrieben von einem Unternehmen, das nur Schweizer Recht untersteht. Es hält vertraglich fest, dass deine Daten nicht zum Training genutzt und nachweisbar gelöscht werden. Und es lässt sich prüfen, wer wann worauf zugegriffen hat. Genau das leistet [Managed Inference](\u002Fde\u002Fmanaged-inference): die offenen Modelle und die Datenhoheit eines eigenen Endpoints, ohne dass du den Betrieb selbst stemmst.\n\n## Der pragmatische Einstieg\n\nFang nicht mit der Technik an, sondern mit der Einordnung: Welche deiner Daten sind wirklich reguliert und welche nicht? Vieles lässt sich unkritisch auf jedem Weg verarbeiten. Für den Teil, der es nicht ist, nimmst du einen [souveränen Endpoint](\u002Fde\u002Fmanaged-inference#wann-sinnvoll) und hältst den Rahmen ein, statt ihn zu dehnen. Sag uns, in welcher Branche du arbeitest und welche Daten im Spiel sind, dann zeigen wir dir den Weg: [Kontakt](\u002Fde\u002Fkontakt).","\u003Ch2>Wo „in der Cloud“ zur Rechtsfrage wird\u003C\u002Fh2>\n\n\u003Cp>Für die meisten Unternehmen ist der Serverstandort eine Präferenz. Für regulierte Branchen ist er eine Grenze, die das Gesetz zieht. Wer mit Patientendaten, Bankkundendaten, Mandatsakten oder Verwaltungsdaten arbeitet, kann nicht einfach den nächstbesten KI-Dienst anbinden. Ein Prompt, der solche Daten enthält und an eine fremde API geht, kann schon der Vorgang sein, der eine Pflicht verletzt, bevor überhaupt eine Antwort zurückkommt.\u003C\u002Fp>\n\n\u003Ch2>Vier Bereiche, ein gemeinsames Problem\u003C\u002Fh2>\n\n\u003Cp>\u003Cstrong>Gesundheit.\u003C\u002Fstrong> Patientendaten fallen unter das Berufsgeheimnis nach Art. 321 StGB. Sie an einen Dritten weiterzugeben, der keiner Schweigepflicht untersteht, ist strafbewehrt, und ein US-Cloud-Anbieter ist ein solcher Dritter.\u003C\u002Fp>\n\n\u003Cp>\u003Cstrong>Finanz.\u003C\u002Fstrong> Bankkundendaten sind besonders geschützt, und die FINMA stellt klare Anforderungen an das Outsourcing wesentlicher Funktionen. Wer Kundendaten durch ein fremdes Modell schickt, muss belegen können, wer darauf zugreift.\u003C\u002Fp>\n\n\u003Cp>\u003Cstrong>Recht.\u003C\u002Fstrong> Das Anwaltsgeheimnis deckt die gesamte Mandatsbeziehung. Eine Kanzlei, die Schriftsätze von einer Cloud-KI zusammenfassen lässt, gibt genau die Daten heraus, die sie schützen muss.\u003C\u002Fp>\n\n\u003Cp>\u003Cstrong>Öffentliche Hand.\u003C\u002Fstrong> Amtsgeheimnis und kantonale Datenschutzgesetze binden Verwaltungen oft enger als die Privatwirtschaft, gerade bei Personendaten der Bürger.\u003C\u002Fp>\n\n\u003Cp>So verschieden die Branchen sind, das Problem ist dasselbe: Die Daten dürfen den kontrollierten Rechtsraum nicht verlassen.\u003C\u002Fp>\n\n\u003Ch2>Warum der Serverstandort allein nicht reicht\u003C\u002Fh2>\n\n\u003Cp>Hier liegt der Denkfehler, den viele Anbieter stehen lassen. Ein Rechenzentrum in der Schweiz klingt nach Lösung, ist aber nur die halbe. Gehört der Anbieter zu einem US-Konzern, unterliegt er dem CLOUD Act, und der greift auf das Unternehmen zu, nicht auf den Standort der Festplatte. Die Daten können physisch in Zürich liegen und rechtlich trotzdem im Zugriff einer fremden Behörde sein. Datenhoheit ist eine Frage der Rechtsordnung über den Betreiber, nicht nur der Geografie. Was das im Detail bedeutet, steht im Beitrag \u003Ca href=\"\u002Fde\u002Fwissen\u002Fdatenhoheit-was-bedeutet-das\">Was Datenhoheit konkret heisst\u003C\u002Fa>.\u003C\u002Fp>\n\n\u003Ch2>Was ein belastbares Setup ausmacht\u003C\u002Fh2>\n\n\u003Cp>Ein Setup, das dem Rahmen standhält, hat vier Merkmale. Es läuft auf offenen Modellen, damit keine Daten zum Training eines fremden Anbieters abfliessen. Es läuft auf Hardware in der Schweiz, betrieben von einem Unternehmen, das nur Schweizer Recht untersteht. Es hält vertraglich fest, dass deine Daten nicht zum Training genutzt und nachweisbar gelöscht werden. Und es lässt sich prüfen, wer wann worauf zugegriffen hat. Genau das leistet \u003Ca href=\"\u002Fde\u002Fmanaged-inference\">Managed Inference\u003C\u002Fa>: die offenen Modelle und die Datenhoheit eines eigenen Endpoints, ohne dass du den Betrieb selbst stemmst.\u003C\u002Fp>\n\n\u003Ch2>Der pragmatische Einstieg\u003C\u002Fh2>\n\n\u003Cp>Fang nicht mit der Technik an, sondern mit der Einordnung: Welche deiner Daten sind wirklich reguliert und welche nicht? Vieles lässt sich unkritisch auf jedem Weg verarbeiten. Für den Teil, der es nicht ist, nimmst du einen \u003Ca href=\"\u002Fde\u002Fmanaged-inference#wann-sinnvoll\">souveränen Endpoint\u003C\u002Fa> und hältst den Rahmen ein, statt ihn zu dehnen. Sag uns, in welcher Branche du arbeitest und welche Daten im Spiel sind, dann zeigen wir dir den Weg: \u003Ca href=\"\u002Fde\u002Fkontakt\">Kontakt\u003C\u002Fa>.\u003C\u002Fp>\n",[],[],[40,43,46],{"title":41,"href":42},"Preise","\u002Fde\u002Fpreise",{"title":44,"href":45},"Wissen","\u002Fde\u002Fwissen",{"title":47,"href":48},"Über Twentyone","\u002Fde\u002Fueber-uns",[50,54,58,59],{"title":51,"href":52,"description":53},"DGX Spark mieten","\u002Fde\u002Fdgx-spark","Der NVIDIA-AI-Supercomputer für den Schreibtisch — on-demand aus der Schweiz, bare metal oder gemanagt.",{"title":55,"href":56,"description":57},"Bare Metal GPU","\u002Fde\u002Fbare-metal","DGX Spark & H100 als dedizierte Maschine — volle Kontrolle, Root-Zugriff, Schweizer Rechenzentrum.",{"title":31,"href":23,"description":32},{"title":60,"href":61,"description":62},"Hermes Agents","\u002Fde\u002Fagents","Agentische Workloads gemanagt — Hermes-Agents auf souveräner Hardware, von uns betrieben.",[],[65,72],{"title":66,"links":67},"Leistungen",[68,69,70,71],{"title":51,"href":52},{"title":55,"href":56},{"title":31,"href":23},{"title":60,"href":61},{"title":73,"links":74},"Unternehmen",[75,76,77,78],{"title":47,"href":48},{"title":44,"href":45},{"title":41,"href":42},{"title":79,"href":80},"Kontakt","\u002Fde\u002Fkontakt",[82,91,103,113,116,124,131,138,144,150,156,163,169,175,181,187,193,200],{"path":83,"slug":84,"title":85,"summary":86,"image":87,"publication_date":19,"big5_category":88,"primary_hub":87,"cluster":87,"pillar":87,"hubs":89},"\u002Fde\u002Fwissen\u002Fazure-openai-bedrock-alternative-schweiz","azure-openai-bedrock-alternative-schweiz","Souveräne Inferenz gegen Azure OpenAI und AWS Bedrock: was sich im Alltag ändert","Azure OpenAI und AWS Bedrock gegen einen souverän betriebenen Endpoint: warum der Schweizer Serverstandort der Hyperscaler das Kernproblem nicht löst und was der Unterschied im Betrieb bedeutet.",null,"comparisons",[90],{"slug":22,"title":31},{"path":92,"slug":93,"title":94,"summary":95,"image":87,"publication_date":19,"big5_category":96,"primary_hub":87,"cluster":87,"pillar":87,"hubs":97},"\u002Fde\u002Fwissen\u002Fbeste-gpu-llm-inferenz","beste-gpu-llm-inferenz","Die beste GPU für LLM-Inferenz: DGX Spark, H100, L40S und RTX im Vergleich","Welche GPU für eigene Inferenz? DGX Spark, H100, L40S und RTX 4090 nach dem, was zählt: wie viel Modell hineinpasst, wie viel Durchsatz herauskommt und was der Monat kostet.","bestof",[98,101],{"slug":99,"title":100},"bare-metal","Bare Metal GPU mit Root-Zugriff",{"slug":102,"title":51},"dgx-spark",{"path":104,"slug":105,"title":106,"summary":107,"image":87,"publication_date":19,"big5_category":108,"primary_hub":87,"cluster":87,"pillar":87,"hubs":109},"\u002Fde\u002Fwissen\u002Fhermes-agent-erfahrungsbericht","hermes-agent-erfahrungsbericht","Hermes-Agent im Realbetrieb: was ein souveräner Agent wirklich leistet","Ein Erfahrungsbericht statt Hochglanzprospekt: wie sich ein souverän betriebener Hermes-Agent im täglichen Einsatz verhält, wo er glänzt und wo die Begleitung anfängt.","reviews",[110],{"slug":111,"title":112},"agents","Hermes Agents as a Service",{"path":6,"slug":7,"title":14,"summary":15,"image":87,"publication_date":19,"big5_category":18,"primary_hub":87,"cluster":87,"pillar":87,"hubs":114},[115],{"slug":22,"title":31},{"path":117,"slug":118,"title":119,"summary":120,"image":87,"publication_date":19,"big5_category":121,"primary_hub":87,"cluster":87,"pillar":87,"hubs":122},"\u002Fde\u002Fwissen\u002Fopenai-api-kosten-vs-eigener-endpoint","openai-api-kosten-vs-eigener-endpoint","Ab welchem Volumen sich ein eigener Endpoint gegen die API rechnet","Die Pay-per-Token-API ist günstig, bis sie es nicht mehr ist. Wo genau der Break-even zu einem reservierten Endpoint mit fester Monatspauschale liegt, an einem konkreten Beispiel durchgerechnet.","cost",[123],{"slug":22,"title":31},{"path":125,"slug":126,"title":127,"summary":128,"image":87,"publication_date":129,"big5_category":88,"primary_hub":87,"cluster":87,"pillar":87,"hubs":130},"\u002Fde\u002Fwissen\u002Ffine-tuning-rag-prompt","fine-tuning-rag-prompt","Fine-Tuning, RAG oder besserer Prompt? Die klare Entscheidungsregel","Fine-Tuning ist meistens nicht die Antwort auf „das Modell kennt unsere Daten nicht“. Wann Prompting, RAG oder Fine-Tuning wirklich das richtige Werkzeug sind und wie du die Eskalationsleiter korrekt durchläufst.","2026-07-07T00:00:00Z",[],{"path":132,"slug":133,"title":134,"summary":135,"image":87,"publication_date":129,"big5_category":136,"primary_hub":87,"cluster":87,"pillar":87,"hubs":137},"\u002Fde\u002Fwissen\u002Fopenai-api-migration","openai-api-migration","Von der OpenAI-API zu souveräner Inferenz: die Migration in der Praxis","Der Umstieg von OpenAI oder Anthropic auf ein selbst betriebenes offenes Modell in der Schweiz sieht dank OpenAI-kompatibler Endpoints nach einer Ein-Zeilen-Änderung aus, ist aber doch mehr. Wo Prompts, Tool-Calling und Feature-Lücken zur Stolperfalle werden.","how-to",[],{"path":139,"slug":140,"title":141,"summary":142,"image":87,"publication_date":129,"big5_category":18,"primary_hub":87,"cluster":87,"pillar":87,"hubs":143},"\u002Fde\u002Fwissen\u002Fquantisierung-int4-int8-awq-gptq-gguf","quantisierung-int4-int8-awq-gptq-gguf","Quantisierung ohne Qualitätsverlust: int4, int8, AWQ, GPTQ, GGUF entzaubert","int8 ist fast immer verlustfrei, int4 meistens auch, aber nicht bei Reasoning, Code und langen Agenten-Ketten. Wir zeigen dir ungeschönt, was Quantisierung wirklich kostet und wo GPTQ, AWQ, GGUF und bitsandbytes hingehören.",[],{"path":145,"slug":146,"title":147,"summary":148,"image":87,"publication_date":129,"big5_category":18,"primary_hub":87,"cluster":87,"pillar":87,"hubs":149},"\u002Fde\u002Fwissen\u002Frag-schlechte-antworten","rag-schlechte-antworten","RAG richtig gebaut: warum eure Wissensbasis schlechte Antworten gibt","Die meisten RAG-Systeme scheitern nicht am Sprachmodell, sondern am Retrieval davor. Wir zeigen die häufigsten Fehlerquellen bei Chunking, Embeddings und Retrieval-Strategie sowie, wie du Retrieval- und Generationsfehler sauber auseinanderhältst.",[],{"path":151,"slug":152,"title":153,"summary":154,"image":87,"publication_date":129,"big5_category":136,"primary_hub":87,"cluster":87,"pillar":87,"hubs":155},"\u002Fde\u002Fwissen\u002Fvram-modell-gpu-berechnen","vram-modell-gpu-berechnen","Welches Modell passt auf welche GPU? VRAM richtig berechnen","Bevor du GPUs kaufst oder mietest: die Faustformel für Gewichte, KV-Cache und Overhead, damit du weisst, welches Modell wirklich auf deine Hardware passt.",[],{"path":157,"slug":158,"title":159,"summary":160,"image":87,"publication_date":161,"big5_category":18,"primary_hub":87,"cluster":87,"pillar":87,"hubs":162},"\u002Fde\u002Fwissen\u002Fagent-oder-endpoint","agent-oder-endpoint","Braucht ihr wirklich einen Agent oder reicht ein Endpoint?","Agenten sind im Trend, aber oft die teurere und fragilere Lösung für ein Problem, das ein einfacher Endpoint löst. Wann sich der Aufwand lohnt und wann nicht.","2026-06-30T00:00:00Z",[],{"path":164,"slug":165,"title":166,"summary":167,"image":87,"publication_date":161,"big5_category":18,"primary_hub":87,"cluster":87,"pillar":87,"hubs":168},"\u002Fde\u002Fwissen\u002Fdatenhoheit-was-bedeutet-das","datenhoheit-was-bedeutet-das","Was Datenhoheit konkret heisst und wo deine Prompts wirklich landen","Datenhoheit ist mehr als ein Hosting-Standort. Was rechtlich, technisch und vertraglich dahintersteckt, und welche Fragen du jedem AI-Anbieter stellen solltest.",[],{"path":170,"slug":171,"title":172,"summary":173,"image":87,"publication_date":161,"big5_category":108,"primary_hub":87,"cluster":87,"pillar":87,"hubs":174},"\u002Fde\u002Fwissen\u002Fdgx-spark-erfahrungsbericht","dgx-spark-erfahrungsbericht","DGX Spark im Betrieb: was die Maschine nach drei Monaten wirklich kann","Kein Datenblatt, sondern ein Erfahrungsbericht. Wo die DGX Spark im täglichen Betrieb glänzt, wo ihre Grenzen liegen und für wen sich die Maschine lohnt.",[],{"path":176,"slug":177,"title":178,"summary":179,"image":87,"publication_date":161,"big5_category":136,"primary_hub":87,"cluster":87,"pillar":87,"hubs":180},"\u002Fde\u002Fwissen\u002Fllm-endpoint-aufsetzen","llm-endpoint-aufsetzen","Eigenen LLM Endpoint aufsetzen: von der GPU zum ersten Token","Ein realistischer Weg vom blanken Server zum produktiven Inferenz-Endpoint. Die Schritte, die Reihenfolge und die Stolpersteine, die zwischen „läuft lokal“ und „läuft produktiv“ liegen.",[],{"path":182,"slug":183,"title":184,"summary":185,"image":87,"publication_date":161,"big5_category":96,"primary_hub":87,"cluster":87,"pillar":87,"hubs":186},"\u002Fde\u002Fwissen\u002Foffene-modelle-auswahl","offene-modelle-auswahl","Welches offene Modell für welche Aufgabe? Llama, Qwen, Mistral & Co.","Nicht das grösste Modell gewinnt, sondern das passende. Wie du offene Modelle nach Aufgabe, Speicherbedarf und Lizenz auswählst, statt Benchmarks hinterherzulaufen.",[],{"path":188,"slug":189,"title":190,"summary":191,"image":87,"publication_date":161,"big5_category":88,"primary_hub":87,"cluster":87,"pillar":87,"hubs":192},"\u002Fde\u002Fwissen\u002Fvllm-ollama-tgi-vergleich","vllm-ollama-tgi-vergleich","vLLM, Ollama oder TGI: welche Inference Engine für welchen Fall","Die Engine entscheidet über Durchsatz, Latenz und Betriebsaufwand. Ein nüchterner Vergleich der drei verbreitetsten Optionen, inklusive der Fälle, in denen die einfache Lösung gewinnt.",[],{"path":194,"slug":195,"title":196,"summary":197,"image":87,"publication_date":198,"big5_category":88,"primary_hub":87,"cluster":87,"pillar":87,"hubs":199},"\u002Fde\u002Fwissen\u002Fdgx-spark-vs-cloud-gpu","dgx-spark-vs-cloud-gpu","DGX Spark gegen Cloud-GPU: wann sich eigene Hardware lohnt","Unified Memory gegen rohen Durchsatz, Schweizer Hardware gegen Hyperscaler. Ein nüchterner Vergleich, inklusive der Fälle, in denen die Cloud gewinnt.","2026-06-18T00:00:00Z",[],{"path":201,"slug":202,"title":203,"summary":204,"image":87,"publication_date":198,"big5_category":121,"primary_hub":87,"cluster":87,"pillar":87,"hubs":205},"\u002Fde\u002Fwissen\u002Fllm-selbst-betreiben-kosten","llm-selbst-betreiben-kosten","Was kostet es, ein LLM selbst zu betreiben?","Die nüchterne Rechnung hinter eigenen LLM-Endpoints: Hardware, Betrieb und der Punkt, ab dem sich Selbermachen wirklich lohnt.",[]]