Die Fragen vor jedem AI-Projekt
Was kostet eigene Inferenz? Lokal oder Cloud? Was bedeutet Datenhoheit konkret? Hier beantworten wir die Fragen, die Entwickler stellen, bevor sie sich für eine AI-Infrastruktur entscheiden. Ehrlich und ohne Verkaufsbrille.
Juli 2026
- Souveräne Inferenz gegen Azure OpenAI und AWS Bedrock: was sich im Alltag ändert
- Die beste GPU für LLM-Inferenz: DGX Spark, H100, L40S und RTX im Vergleich
- Hermes-Agent im Realbetrieb: was ein souveräner Agent wirklich leistet
- KI mit regulierten Daten: LLMs nutzen, ohne dass die Daten die Schweiz verlassen
- Ab welchem Volumen sich ein eigener Endpoint gegen die API rechnet
- Fine-Tuning, RAG oder besserer Prompt? Die klare Entscheidungsregel
- Von der OpenAI-API zu souveräner Inferenz: die Migration in der Praxis
- Quantisierung ohne Qualitätsverlust: int4, int8, AWQ, GPTQ, GGUF entzaubert
- RAG richtig gebaut: warum eure Wissensbasis schlechte Antworten gibt
- Welches Modell passt auf welche GPU? VRAM richtig berechnen
Juni 2026
- Braucht ihr wirklich einen Agent oder reicht ein Endpoint?
- Was Datenhoheit konkret heisst und wo deine Prompts wirklich landen
- DGX Spark im Betrieb: was die Maschine nach drei Monaten wirklich kann
- Eigenen LLM Endpoint aufsetzen: von der GPU zum ersten Token
- Welches offene Modell für welche Aufgabe? Llama, Qwen, Mistral & Co.
- vLLM, Ollama oder TGI: welche Inference Engine für welchen Fall
- DGX Spark gegen Cloud-GPU: wann sich eigene Hardware lohnt
- Was kostet es, ein LLM selbst zu betreiben?
Themen, nach denen Entwickler suchen
Was kostet eigene AI-Infrastruktur?
Die volle Rechnung hinter eigenen LLM-Endpoints, und ab wann sich Selbermachen lohnt.
DGX Spark oder Cloud-GPU?
Unified Memory gegen Durchsatz, Schweizer Hardware gegen Hyperscaler. Ein ehrlicher Vergleich.
Lokal oder gemanagt betreiben?
Wann ein gemanagter Endpoint reicht und wann du Root brauchst.
Was Datenhoheit konkret heisst
Warum es einen Unterschied macht, in welchem Land deine Prompts verarbeitet werden.
DGX Spark verstehen
Was die Maschine kann, wo ihre Grenzen sind und für welche Workloads sie gebaut ist.
Agents richtig einsetzen
Wann ein Agent der richtige Weg ist und wann ein einfacher Endpoint reicht.