[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"reazon-offering-angebot-leistungen":3,"reazon-offering-angebot-zielgruppen":20,"reazon-angebot-subnav":21,"reazon-mainnav":22,"reazon-page-\u002Fde\u002Fwissen\u002Fhermes-agent-erfahrungsbericht":32,"reazon-footernav":65,"reazon-articles-\u002Fde\u002Fwissen":82},[4,8,12,16],{"title":5,"href":6,"description":7},"DGX Spark mieten","\u002Fde\u002Fdgx-spark","Der NVIDIA-AI-Supercomputer für den Schreibtisch — on-demand aus der Schweiz, bare metal oder gemanagt.",{"title":9,"href":10,"description":11},"Bare Metal GPU","\u002Fde\u002Fbare-metal","DGX Spark & H100 als dedizierte Maschine — volle Kontrolle, Root-Zugriff, Schweizer Rechenzentrum.",{"title":13,"href":14,"description":15},"Managed Inference","\u002Fde\u002Fmanaged-inference","LLM-Endpoints via vLLM — von uns betrieben, ohne Ops-Aufwand, mit Schweizer Datenhoheit.",{"title":17,"href":18,"description":19},"Hermes Agents","\u002Fde\u002Fagents","Agentische Workloads gemanagt — Hermes-Agents auf souveräner Hardware, von uns betrieben.",[],[],[23,26,29],{"title":24,"href":25},"Preise","\u002Fde\u002Fpreise",{"title":27,"href":28},"Wissen","\u002Fde\u002Fwissen",{"title":30,"href":31},"Über Twentyone","\u002Fde\u002Fueber-uns",{"data":33},{"id":34,"path":35,"slug":36,"published_at":37,"page_type":38,"no_index":41,"fields":42,"blocks":64},1485,"\u002Fde\u002Fwissen\u002Fhermes-agent-erfahrungsbericht","hermes-agent-erfahrungsbericht","2026-07-13T09:40:29.682Z",{"identifier":39,"name":40},"article","Blog Post",false,{"title":43,"summary":44,"meta_title":45,"meta_description":46,"big5_category":47,"publication_date":48,"primary_service":49,"hubs":55,"body":62,"body_html":63},"Hermes-Agent im Realbetrieb: was ein souveräner Agent wirklich leistet","Ein Erfahrungsbericht statt Hochglanzprospekt: wie sich ein souverän betriebener Hermes-Agent im täglichen Einsatz verhält, wo er glänzt und wo die Begleitung anfängt.","Hermes-Agent im Realbetrieb: Erfahrungsbericht | Twentyone","Kein Datenblatt: was ein selbst betriebener Hermes-Agent mit Tool-Use und Gedächtnis im Alltag leistet, wo er stockt und wann sich die Agent-Schicht lohnt.","reviews","2026-07-13T00:00:00Z",{"id":50,"slug":51,"path":18,"page_type":52,"published":53,"type":54},677,"agents","service",true,"Cms::Page",[56],{"hub":57},{"id":50,"slug":51,"path":18,"page_type":52,"published":53,"fields":58,"type":54},{"title":59,"summary":19,"meta_description":60,"meta_title":61},"Hermes Agents as a Service","Hermes-Agents (Nous Research) als gemanagter Dienst auf DGX-Spark-Hardware in der Schweiz. Persistentes Gedächtnis, Tool-Use, Datenhoheit. Kosten und Einsatz.","Hermes Agents as a Service — souverän & gemanagt | Twentyone","## Warum wir überhaupt selbst Agents fahren\n\nDieser Bericht kommt nicht aus einem Datenblatt, sondern aus dem eigenen Betrieb. Wir fahren Hermes-Agents für unsere eigene Arbeit, auf genau der Hardware, die auch buchbar ist. Das ist der Grund, warum wir über Agents as a Service überhaupt reden: Wir nutzen sie täglich und kennen sie aus echten Fällen, nicht aus dem Prospekt. Was folgt, ist die nüchterne Einordnung, wo ein souverän betriebener Agent hält, was er verspricht, und wo die Begleitung anfängt.\n\n## Was Hermes von einem reinen Chat-Modell unterscheidet\n\nHermes ist eine Familie offener Modelle von Nous Research, die gezielt auf Tool-Use und agentisches Verhalten trainiert ist. Der Unterschied zu einem reinen Chat-Modell ist nicht die Sprache, sondern das Handeln: Ein Hermes-Agent ruft Funktionen, APIs und Datenquellen auf, statt nur Text zu produzieren. Er entscheidet, welches Werkzeug er wann braucht, und arbeitet über mehrere Schritte auf ein Ziel hin. Weil das Modell offen ist, läuft es auf eigener Hardware, ohne dass Prompts durch eine fremde Cloud wandern.\n\n## Wo der Agent im Alltag glänzt\n\nAm stärksten ist der Agent bei wiederkehrenden Aufgaben, die mehr als eine Antwort brauchen: etwas recherchieren, ein Werkzeug bedienen, einen Zwischenstand merken, weitermachen. Das persistente Gedächtnis ist dabei der Punkt, der im Alltag den Unterschied macht. Der Agent vergisst nicht nach jedem Aufruf, sondern behält Kontext über Sitzungen hinweg. Eine Aufgabe, die sich über Stunden oder Tage zieht, bleibt zusammenhängend, statt bei jedem Neustart von vorn zu beginnen.\n\n## Wo es stockt\n\nDie Grenzen liegen dort, wo die Autonomie beginnt. Jeder zusätzliche Schritt in einer Kette ist eine Stelle, an der etwas schiefgehen kann, und kleine Fehler früh in der Kette verstärken sich nach hinten. Jedes zusätzliche Werkzeug ist eine zusätzliche Fehlerquelle. Dazu kommt die Latenz: Ein Agent, der fünf Schritte geht und dreimal ein Werkzeug aufruft, antwortet nicht in Millisekunden. Und agentische Systeme sind jünger als klassische Endpoints, sie brauchen mehr Beobachtung, bis sie in einem Fall zuverlässig laufen. Ein Detail aus der Praxis: Lange Ketten reagieren empfindlicher auf zu grobe [Quantisierung](\u002Fde\u002Fwissen\u002Fquantisierung-int4-int8-awq-gptq-gguf) als ein einzelner Prompt, weil sich der Qualitätsverlust über die Schritte summiert.\n\n## Was der Betrieb wirklich bedeutet\n\nEin Agent wird nicht gut, indem man ihn hinstellt, sondern indem man ihn an echten Fällen beobachtet und nachschärft. Das heisst: sehen, welche Werkzeuge er wann aufruft, wo er abbiegt, wo er hängt, und die Freigaben und Prompts entsprechend enger ziehen. Genau diese Begleitphase ist der Teil, den ein Datenblatt nie zeigt und den wir aus dem eigenen Betrieb kennen. Wer den Agent gemanagt bezieht, erbt diesen Betrieb nicht selbst, behält aber die Hoheit über Daten und Verhalten.\n\n## Wann sich die Agent-Schicht lohnt\n\nDie Regel ist einfach, und sie spricht oft gegen den Agent: Wenn ein einzelner Prompt an einen [Endpoint](\u002Fde\u002Fmanaged-inference) reicht, nimm den Endpoint und spar dir die Agent-Schicht. Ob dein Fall überhaupt einen Agent braucht, klärt der Beitrag [Agent oder Endpoint](\u002Fde\u002Fwissen\u002Fagent-oder-endpoint). Lohnt sich die Schicht, dann läuft der Agent bei uns auf [Schweizer Hardware](\u002Fde\u002Fagents), von uns betrieben. Beschreib uns die Aufgabe, die du automatisieren willst, und wir sagen dir, ob ein Agent der richtige Weg ist: [Kontakt](\u002Fde\u002Fkontakt).","\u003Ch2>Warum wir überhaupt selbst Agents fahren\u003C\u002Fh2>\n\n\u003Cp>Dieser Bericht kommt nicht aus einem Datenblatt, sondern aus dem eigenen Betrieb. Wir fahren Hermes-Agents für unsere eigene Arbeit, auf genau der Hardware, die auch buchbar ist. Das ist der Grund, warum wir über Agents as a Service überhaupt reden: Wir nutzen sie täglich und kennen sie aus echten Fällen, nicht aus dem Prospekt. Was folgt, ist die nüchterne Einordnung, wo ein souverän betriebener Agent hält, was er verspricht, und wo die Begleitung anfängt.\u003C\u002Fp>\n\n\u003Ch2>Was Hermes von einem reinen Chat-Modell unterscheidet\u003C\u002Fh2>\n\n\u003Cp>Hermes ist eine Familie offener Modelle von Nous Research, die gezielt auf Tool-Use und agentisches Verhalten trainiert ist. Der Unterschied zu einem reinen Chat-Modell ist nicht die Sprache, sondern das Handeln: Ein Hermes-Agent ruft Funktionen, APIs und Datenquellen auf, statt nur Text zu produzieren. Er entscheidet, welches Werkzeug er wann braucht, und arbeitet über mehrere Schritte auf ein Ziel hin. Weil das Modell offen ist, läuft es auf eigener Hardware, ohne dass Prompts durch eine fremde Cloud wandern.\u003C\u002Fp>\n\n\u003Ch2>Wo der Agent im Alltag glänzt\u003C\u002Fh2>\n\n\u003Cp>Am stärksten ist der Agent bei wiederkehrenden Aufgaben, die mehr als eine Antwort brauchen: etwas recherchieren, ein Werkzeug bedienen, einen Zwischenstand merken, weitermachen. Das persistente Gedächtnis ist dabei der Punkt, der im Alltag den Unterschied macht. Der Agent vergisst nicht nach jedem Aufruf, sondern behält Kontext über Sitzungen hinweg. Eine Aufgabe, die sich über Stunden oder Tage zieht, bleibt zusammenhängend, statt bei jedem Neustart von vorn zu beginnen.\u003C\u002Fp>\n\n\u003Ch2>Wo es stockt\u003C\u002Fh2>\n\n\u003Cp>Die Grenzen liegen dort, wo die Autonomie beginnt. Jeder zusätzliche Schritt in einer Kette ist eine Stelle, an der etwas schiefgehen kann, und kleine Fehler früh in der Kette verstärken sich nach hinten. Jedes zusätzliche Werkzeug ist eine zusätzliche Fehlerquelle. Dazu kommt die Latenz: Ein Agent, der fünf Schritte geht und dreimal ein Werkzeug aufruft, antwortet nicht in Millisekunden. Und agentische Systeme sind jünger als klassische Endpoints, sie brauchen mehr Beobachtung, bis sie in einem Fall zuverlässig laufen. Ein Detail aus der Praxis: Lange Ketten reagieren empfindlicher auf zu grobe \u003Ca href=\"\u002Fde\u002Fwissen\u002Fquantisierung-int4-int8-awq-gptq-gguf\">Quantisierung\u003C\u002Fa> als ein einzelner Prompt, weil sich der Qualitätsverlust über die Schritte summiert.\u003C\u002Fp>\n\n\u003Ch2>Was der Betrieb wirklich bedeutet\u003C\u002Fh2>\n\n\u003Cp>Ein Agent wird nicht gut, indem man ihn hinstellt, sondern indem man ihn an echten Fällen beobachtet und nachschärft. Das heisst: sehen, welche Werkzeuge er wann aufruft, wo er abbiegt, wo er hängt, und die Freigaben und Prompts entsprechend enger ziehen. Genau diese Begleitphase ist der Teil, den ein Datenblatt nie zeigt und den wir aus dem eigenen Betrieb kennen. Wer den Agent gemanagt bezieht, erbt diesen Betrieb nicht selbst, behält aber die Hoheit über Daten und Verhalten.\u003C\u002Fp>\n\n\u003Ch2>Wann sich die Agent-Schicht lohnt\u003C\u002Fh2>\n\n\u003Cp>Die Regel ist einfach, und sie spricht oft gegen den Agent: Wenn ein einzelner Prompt an einen \u003Ca href=\"\u002Fde\u002Fmanaged-inference\">Endpoint\u003C\u002Fa> reicht, nimm den Endpoint und spar dir die Agent-Schicht. Ob dein Fall überhaupt einen Agent braucht, klärt der Beitrag \u003Ca href=\"\u002Fde\u002Fwissen\u002Fagent-oder-endpoint\">Agent oder Endpoint\u003C\u002Fa>. Lohnt sich die Schicht, dann läuft der Agent bei uns auf \u003Ca href=\"\u002Fde\u002Fagents\">Schweizer Hardware\u003C\u002Fa>, von uns betrieben. Beschreib uns die Aufgabe, die du automatisieren willst, und wir sagen dir, ob ein Agent der richtige Weg ist: \u003Ca href=\"\u002Fde\u002Fkontakt\">Kontakt\u003C\u002Fa>.\u003C\u002Fp>\n",[],[66,73],{"title":67,"links":68},"Leistungen",[69,70,71,72],{"title":5,"href":6},{"title":9,"href":10},{"title":13,"href":14},{"title":17,"href":18},{"title":74,"links":75},"Unternehmen",[76,77,78,79],{"title":30,"href":31},{"title":27,"href":28},{"title":24,"href":25},{"title":80,"href":81},"Kontakt","\u002Fde\u002Fkontakt",[83,93,105,108,116,124,131,138,144,150,156,163,169,175,181,187,193,200],{"path":84,"slug":85,"title":86,"summary":87,"image":88,"publication_date":48,"big5_category":89,"primary_hub":88,"cluster":88,"pillar":88,"hubs":90},"\u002Fde\u002Fwissen\u002Fazure-openai-bedrock-alternative-schweiz","azure-openai-bedrock-alternative-schweiz","Souveräne Inferenz gegen Azure OpenAI und AWS Bedrock: was sich im Alltag ändert","Azure OpenAI und AWS Bedrock gegen einen souverän betriebenen Endpoint: warum der Schweizer Serverstandort der Hyperscaler das Kernproblem nicht löst und was der Unterschied im Betrieb bedeutet.",null,"comparisons",[91],{"slug":92,"title":13},"managed-inference",{"path":94,"slug":95,"title":96,"summary":97,"image":88,"publication_date":48,"big5_category":98,"primary_hub":88,"cluster":88,"pillar":88,"hubs":99},"\u002Fde\u002Fwissen\u002Fbeste-gpu-llm-inferenz","beste-gpu-llm-inferenz","Die beste GPU für LLM-Inferenz: DGX Spark, H100, L40S und RTX im Vergleich","Welche GPU für eigene Inferenz? DGX Spark, H100, L40S und RTX 4090 nach dem, was zählt: wie viel Modell hineinpasst, wie viel Durchsatz herauskommt und was der Monat kostet.","bestof",[100,103],{"slug":101,"title":102},"bare-metal","Bare Metal GPU mit Root-Zugriff",{"slug":104,"title":5},"dgx-spark",{"path":35,"slug":36,"title":43,"summary":44,"image":88,"publication_date":48,"big5_category":47,"primary_hub":88,"cluster":88,"pillar":88,"hubs":106},[107],{"slug":51,"title":59},{"path":109,"slug":110,"title":111,"summary":112,"image":88,"publication_date":48,"big5_category":113,"primary_hub":88,"cluster":88,"pillar":88,"hubs":114},"\u002Fde\u002Fwissen\u002Fki-regulierte-daten-schweiz","ki-regulierte-daten-schweiz","KI mit regulierten Daten: LLMs nutzen, ohne dass die Daten die Schweiz verlassen","Für Branchen, in denen Daten das Land nicht verlassen dürfen: was revDSG, Berufsgeheimnis und der CLOUD Act für KI-Projekte bedeuten, und wie souveräne Inferenz den Rahmen einhält.","problems",[115],{"slug":92,"title":13},{"path":117,"slug":118,"title":119,"summary":120,"image":88,"publication_date":48,"big5_category":121,"primary_hub":88,"cluster":88,"pillar":88,"hubs":122},"\u002Fde\u002Fwissen\u002Fopenai-api-kosten-vs-eigener-endpoint","openai-api-kosten-vs-eigener-endpoint","Ab welchem Volumen sich ein eigener Endpoint gegen die API rechnet","Die Pay-per-Token-API ist günstig, bis sie es nicht mehr ist. Wo genau der Break-even zu einem reservierten Endpoint mit fester Monatspauschale liegt, an einem konkreten Beispiel durchgerechnet.","cost",[123],{"slug":92,"title":13},{"path":125,"slug":126,"title":127,"summary":128,"image":88,"publication_date":129,"big5_category":89,"primary_hub":88,"cluster":88,"pillar":88,"hubs":130},"\u002Fde\u002Fwissen\u002Ffine-tuning-rag-prompt","fine-tuning-rag-prompt","Fine-Tuning, RAG oder besserer Prompt? Die klare Entscheidungsregel","Fine-Tuning ist meistens nicht die Antwort auf „das Modell kennt unsere Daten nicht“. Wann Prompting, RAG oder Fine-Tuning wirklich das richtige Werkzeug sind und wie du die Eskalationsleiter korrekt durchläufst.","2026-07-07T00:00:00Z",[],{"path":132,"slug":133,"title":134,"summary":135,"image":88,"publication_date":129,"big5_category":136,"primary_hub":88,"cluster":88,"pillar":88,"hubs":137},"\u002Fde\u002Fwissen\u002Fopenai-api-migration","openai-api-migration","Von der OpenAI-API zu souveräner Inferenz: die Migration in der Praxis","Der Umstieg von OpenAI oder Anthropic auf ein selbst betriebenes offenes Modell in der Schweiz sieht dank OpenAI-kompatibler Endpoints nach einer Ein-Zeilen-Änderung aus, ist aber doch mehr. Wo Prompts, Tool-Calling und Feature-Lücken zur Stolperfalle werden.","how-to",[],{"path":139,"slug":140,"title":141,"summary":142,"image":88,"publication_date":129,"big5_category":113,"primary_hub":88,"cluster":88,"pillar":88,"hubs":143},"\u002Fde\u002Fwissen\u002Fquantisierung-int4-int8-awq-gptq-gguf","quantisierung-int4-int8-awq-gptq-gguf","Quantisierung ohne Qualitätsverlust: int4, int8, AWQ, GPTQ, GGUF entzaubert","int8 ist fast immer verlustfrei, int4 meistens auch, aber nicht bei Reasoning, Code und langen Agenten-Ketten. Wir zeigen dir ungeschönt, was Quantisierung wirklich kostet und wo GPTQ, AWQ, GGUF und bitsandbytes hingehören.",[],{"path":145,"slug":146,"title":147,"summary":148,"image":88,"publication_date":129,"big5_category":113,"primary_hub":88,"cluster":88,"pillar":88,"hubs":149},"\u002Fde\u002Fwissen\u002Frag-schlechte-antworten","rag-schlechte-antworten","RAG richtig gebaut: warum eure Wissensbasis schlechte Antworten gibt","Die meisten RAG-Systeme scheitern nicht am Sprachmodell, sondern am Retrieval davor. Wir zeigen die häufigsten Fehlerquellen bei Chunking, Embeddings und Retrieval-Strategie sowie, wie du Retrieval- und Generationsfehler sauber auseinanderhältst.",[],{"path":151,"slug":152,"title":153,"summary":154,"image":88,"publication_date":129,"big5_category":136,"primary_hub":88,"cluster":88,"pillar":88,"hubs":155},"\u002Fde\u002Fwissen\u002Fvram-modell-gpu-berechnen","vram-modell-gpu-berechnen","Welches Modell passt auf welche GPU? VRAM richtig berechnen","Bevor du GPUs kaufst oder mietest: die Faustformel für Gewichte, KV-Cache und Overhead, damit du weisst, welches Modell wirklich auf deine Hardware passt.",[],{"path":157,"slug":158,"title":159,"summary":160,"image":88,"publication_date":161,"big5_category":113,"primary_hub":88,"cluster":88,"pillar":88,"hubs":162},"\u002Fde\u002Fwissen\u002Fagent-oder-endpoint","agent-oder-endpoint","Braucht ihr wirklich einen Agent oder reicht ein Endpoint?","Agenten sind im Trend, aber oft die teurere und fragilere Lösung für ein Problem, das ein einfacher Endpoint löst. Wann sich der Aufwand lohnt und wann nicht.","2026-06-30T00:00:00Z",[],{"path":164,"slug":165,"title":166,"summary":167,"image":88,"publication_date":161,"big5_category":113,"primary_hub":88,"cluster":88,"pillar":88,"hubs":168},"\u002Fde\u002Fwissen\u002Fdatenhoheit-was-bedeutet-das","datenhoheit-was-bedeutet-das","Was Datenhoheit konkret heisst und wo deine Prompts wirklich landen","Datenhoheit ist mehr als ein Hosting-Standort. Was rechtlich, technisch und vertraglich dahintersteckt, und welche Fragen du jedem AI-Anbieter stellen solltest.",[],{"path":170,"slug":171,"title":172,"summary":173,"image":88,"publication_date":161,"big5_category":47,"primary_hub":88,"cluster":88,"pillar":88,"hubs":174},"\u002Fde\u002Fwissen\u002Fdgx-spark-erfahrungsbericht","dgx-spark-erfahrungsbericht","DGX Spark im Betrieb: was die Maschine nach drei Monaten wirklich kann","Kein Datenblatt, sondern ein Erfahrungsbericht. Wo die DGX Spark im täglichen Betrieb glänzt, wo ihre Grenzen liegen und für wen sich die Maschine lohnt.",[],{"path":176,"slug":177,"title":178,"summary":179,"image":88,"publication_date":161,"big5_category":136,"primary_hub":88,"cluster":88,"pillar":88,"hubs":180},"\u002Fde\u002Fwissen\u002Fllm-endpoint-aufsetzen","llm-endpoint-aufsetzen","Eigenen LLM Endpoint aufsetzen: von der GPU zum ersten Token","Ein realistischer Weg vom blanken Server zum produktiven Inferenz-Endpoint. Die Schritte, die Reihenfolge und die Stolpersteine, die zwischen „läuft lokal“ und „läuft produktiv“ liegen.",[],{"path":182,"slug":183,"title":184,"summary":185,"image":88,"publication_date":161,"big5_category":98,"primary_hub":88,"cluster":88,"pillar":88,"hubs":186},"\u002Fde\u002Fwissen\u002Foffene-modelle-auswahl","offene-modelle-auswahl","Welches offene Modell für welche Aufgabe? Llama, Qwen, Mistral & Co.","Nicht das grösste Modell gewinnt, sondern das passende. Wie du offene Modelle nach Aufgabe, Speicherbedarf und Lizenz auswählst, statt Benchmarks hinterherzulaufen.",[],{"path":188,"slug":189,"title":190,"summary":191,"image":88,"publication_date":161,"big5_category":89,"primary_hub":88,"cluster":88,"pillar":88,"hubs":192},"\u002Fde\u002Fwissen\u002Fvllm-ollama-tgi-vergleich","vllm-ollama-tgi-vergleich","vLLM, Ollama oder TGI: welche Inference Engine für welchen Fall","Die Engine entscheidet über Durchsatz, Latenz und Betriebsaufwand. Ein nüchterner Vergleich der drei verbreitetsten Optionen, inklusive der Fälle, in denen die einfache Lösung gewinnt.",[],{"path":194,"slug":195,"title":196,"summary":197,"image":88,"publication_date":198,"big5_category":89,"primary_hub":88,"cluster":88,"pillar":88,"hubs":199},"\u002Fde\u002Fwissen\u002Fdgx-spark-vs-cloud-gpu","dgx-spark-vs-cloud-gpu","DGX Spark gegen Cloud-GPU: wann sich eigene Hardware lohnt","Unified Memory gegen rohen Durchsatz, Schweizer Hardware gegen Hyperscaler. Ein nüchterner Vergleich, inklusive der Fälle, in denen die Cloud gewinnt.","2026-06-18T00:00:00Z",[],{"path":201,"slug":202,"title":203,"summary":204,"image":88,"publication_date":198,"big5_category":121,"primary_hub":88,"cluster":88,"pillar":88,"hubs":205},"\u002Fde\u002Fwissen\u002Fllm-selbst-betreiben-kosten","llm-selbst-betreiben-kosten","Was kostet es, ein LLM selbst zu betreiben?","Die nüchterne Rechnung hinter eigenen LLM-Endpoints: Hardware, Betrieb und der Punkt, ab dem sich Selbermachen wirklich lohnt.",[]]