Die Kosten von RAG in Azure: Suchindex, Verfügbarkeit und Betrieb

    Zurück zum Blog
    Agentic AI

    Die Kosten von RAG in Azure: Suchindex, Verfügbarkeit und Betrieb

    Welche Kostenblöcke ein RAG-System in Azure verursacht und wie Sie Azure AI Search, Modelle, Verfügbarkeit und Betrieb ohne unbelegte Pauschalbeträge kalkulieren.

    9. August 202611 Min. Lesezeit
    Marcel Haas

    Marcel Haas

    Solution Architect, CEO

    marcel.haas@cnext.ch
    20+ JahreErfahrung·6×Microsoft Applied Skills·SharePoint & Microsoft Copilot
    6x Microsoft Applied Skills

    Kurzantwort

    Welche Kostenblöcke ein RAG-System in Azure verursacht und wie Sie Azure AI Search, Modelle, Verfügbarkeit und Betrieb ohne unbelegte Pauschalbeträge kalkulieren.

    Ein eigener RAG-Stack verursacht fixe und variable Kosten: Suchdienst, Replikate und Partitionen, Embeddings, Ranking, Modellaufrufe, Datenaufbereitung sowie Betrieb. Dieser Artikel wurde am 8. September 2026 anhand der offiziellen Dokumentation zu Azure AI Search, SKU und Kapazität, Verfügbarkeit und Azure OpenAI geprüft.

    Weshalb keine pauschale CHF-Zahl seriös ist

    Azure-Preise hängen unter anderem von Region, Währung, Vertrag, SKU, Partitionen, Replikaten, Modell, Deployment-Typ und Tokenmenge ab. Die offiziellen Preisseiten liefern konfigurierbare Werte und weisen darauf hin, dass tatsächliche Preise abweichen können. Deshalb wurden hier nicht reproduzierbare Monats- und Jahresbeträge sowie unbelegte CHF-Umrechnungen entfernt.

    Die Kostenblöcke

    BlockKostentreiber
    Azure AI SearchSKU, Anzahl Partitionen und Replikate, Laufzeit
    Ranking und agentisches Retrievalaktivierte Funktion und Nutzung gemäss aktueller Preisseite
    Embeddingsgewähltes Modell und verarbeitete Tokens
    AntwortmodellModell, Deployment-Typ, Input- und Output-Tokens
    AufbereitungOCR, Parsing, Chunking und erneute Verarbeitung
    BetriebBerechtigungen, Überwachung, Evaluation, Aktualisierung und Support

    Eine Search Unit ergibt sich aus Replikaten × Partitionen. Microsoft verlangt für das SLA zu Abfragen mindestens zwei Replikate; für das SLA zu Abfragen und Indexierungsupdates mindestens drei. Ob dieses SLA nötig ist, muss aus den Geschäftsanforderungen folgen, nicht aus einer pauschalen Architekturregel.

    Zwei belastbare Kalkulationsmuster

    Kleiner interner Agent: Erfassen Sie Indexgrösse, Änderungsrate, Anfragen, Tokens pro Anfrage und gewünschte Verfügbarkeit. Kalkulieren Sie Produktion und allfällige Testumgebung getrennt. Ein Free-Tier ist ein Entwicklungsangebot und keine Produktionsbaseline.

    Grösserer Dokumentenbestand: Messen Sie die tatsächliche Indexgrösse nach Chunking und Vektorisierung. Die Dokumentzahl allein belegt keine bestimmte Anzahl Partitionen. Planen Sie Re-Indexierung, OCR, Berechtigungsfilter und Wachstum ausdrücklich ein.

    Verwenden Sie für jede Variante den Azure Pricing Calculator und halten Sie Region, Abrufdatum und Annahmen fest. Preise oder Modellverfügbarkeit aus einer anderen Region dürfen nicht ungeprüft auf Switzerland North oder West Europe übertragen werden.

    M365-Inhalte: nativ ist möglich, aber nicht automatisch kostenlos

    Copilot Studio kann SharePoint als Wissensquelle anbinden und Antworten im Kontext der authentifizierten Person erzeugen. Das kann eine eigene Indexierungs-Pipeline vermeiden. Es beseitigt aber nicht automatisch Lizenz-, Credit-, Konnektor- oder Governance-Kosten.

    Microsoft 365 Copilot nutzt Microsoft-365-Daten gemäss den Berechtigungen der angemeldeten Person. Auch hier ist «Indexierung gratis» als isolierte Aussage irreführend: Bezahlt werden die erforderlichen Microsoft-365- und Copilot-Lizenzen; Umfang und Rechte sind im Vertrag zu prüfen.

    Azure AI Search übernimmt SharePoint-Berechtigungen nicht pauschal «automatisch» für jede eigene RAG-Lösung. Der Entwickler muss die unterstützte Datenquelle, den Stand allfälliger Preview-Funktionen und die Security-Filter-Architektur prüfen. Eine Anwendung darf nie allein darauf vertrauen, dass im Quellsystem korrekte ACLs bestehen.

    Wann ein eigener Index sinnvoll sein kann

    • Quellen ausserhalb von Microsoft 365 benötigen kontrolliertes Retrieval.
    • Ranking, Chunking, Evaluation oder Oberfläche müssen individuell steuerbar sein.
    • Mehrere Quellen sollen mit einer eigenen Berechtigungs- und Aktualitätslogik zusammengeführt werden.
    • Vertragliche oder technische Anforderungen verlangen eine explizit definierte Azure-Architektur.

    Umgekehrt kann natives Grounding bei klar abgegrenzten SharePoint-Inhalten den Betriebsaufwand reduzieren. Die Entscheidung ist nach Qualität, Berechtigungen, Residenz, Verfügbarkeit und Total Cost of Ownership zu treffen.

    Datenresidenz mitprüfen

    Bei Azure OpenAI werden Prompts und Antworten bei regionalen Standard-Deployments innerhalb der gewählten Azure-Geografie verarbeitet; Global- und Data-Zone-Deployments folgen anderen Regeln (Microsoft Data Privacy, geprüft am 8. September 2026). Modell- und Funktionsverfügbarkeit ist regionsabhängig. «Azure» allein garantiert deshalb weder Verarbeitung ausschliesslich in der Schweiz noch die Verfügbarkeit jedes Modells in Switzerland North.

    Fazit

    Der Suchdienst kann ein relevanter Fixkostenblock sein, doch eine universelle Spanne pro Monat ist nicht belastbar. Eine prüfbare RAG-Kalkulation nennt SKU, Region, Replikate, Partitionen, Modelle, Tokens, Umgebungen und Betriebsaufwand und verlinkt die am Stichtag verwendeten Preisquellen.

    Weiterführend: Company Brain Plattformvergleich · Kontakt aufnehmen

    Agentic AIAzure AICopilot StudioSharePointSchweiz
    Teilen:

    Dieser Artikel wurde mit Unterstützung von KI erstellt und von unserem Team geprüft. Wir setzen KI-Tools ein, um hochwertige Inhalte effizient zu produzieren — die fachliche Verantwortung liegt immer bei unseren Experten.

    Marcel Haas

    Marcel Haas

    Solution Architect, CEO

    6x Microsoft Applied Skills

    Haben Sie Fragen zu diesem Thema?

    Unsere Experten beraten Sie gerne – kostenlos und unverbindlich.