---
title: "Voice AI braucht eine zweistufige Architektur"
description: "Gemini 3.8 Live und GPT-Live-1 trennen Gespräch und Aufgabenlogik. Was Unternehmen bei Architektur, Kosten und Kontrolle prüfen sollten."
date: 2026-09-16
lang: de
tags: [voice-ai, governance, kosten, automatisierung, analyse]
author: "thinkai.at"
canonical: https://thinkai.at/blog/voice-ai-zweistufige-architektur/
---

# Voice AI braucht eine zweistufige Architektur

**Voice AI** wird zu einer Architektur aus Gesprächsschicht und Aufgabenmotor. Google hat am 15. September Gemini 3.8 Live sowie Gemini 3.8 Live Extended Thinking vorgestellt. OpenAI bietet seit dem 10. September GPT-Live-1 in der API an. Beide Ankündigungen zeigen: Natürliche Sprache allein reicht für produktive Telefon- und Serviceprozesse nicht.

## Zwei Aufgaben, zwei technische Takte

Gemini 3.8 Live ist laut Google für niedrige Latenz und skalierbare Dialoge ausgelegt. Das Modell verarbeitet Audio, Text, Bilder und Video, unterstützt asynchrone Funktionsaufrufe und kann während eines Gesprächs Werkzeuge im Hintergrund bedienen. Google nennt außerdem automatische Sprachwechsel zwischen 97 Sprachen. Für komplexere Abläufe gibt es Gemini 3.8 Live Extended Thinking mit Hintergrund-Reasoning und nicht blockierenden Tool-Aufrufen.

OpenAI trennt die Rollen noch deutlicher: GPT-Live-1 führt das Gespräch, während ein frei wählbares Backend-Modell oder ein Agent die aufwendige Recherche, Regeln und Tool-Aufrufe übernimmt. Die Sprachschicht kostet laut Anbieter 0,05 US-Dollar pro Minute; Backend-Modell, Agenten-Harness und angebundene Systeme kommen hinzu.

## Der entscheidende Entwurf liegt zwischen den Schichten

Für einen Voice-Agenten im Kundenservice sollten Sie drei Ebenen getrennt planen:

- **Gespräch:** Unterbrechungen, Pausen, Hintergrundgeräusche, Sprache und Tonalität.
- **Aufgabe:** Identität, Geschäftsregeln, Datenzugriff, Tools und Fehlerbehandlung.
- **Kontrolle:** Bestätigung vor einer Aktion, Abbruchlogik, Übergabe an Menschen und Audit-Protokoll.

Diese Trennung verhindert einen teuren Denkfehler: Eine natürliche Stimme macht einen fehlerhaften Prozess nicht belastbar. Besonders wichtig ist der Abbruchpfad. OpenAI weist darauf hin, dass das Unterbrechen der Sprachausgabe eine bereits delegierte Backend-Aufgabe nicht automatisch stoppt. Ihre Anwendung muss Zustände, Berechtigungen und Stornierung selbst beherrschen.

## Was DACH-Unternehmen im Pilot messen sollten

Prüfen Sie neben Antwortzeit und Sprachqualität auch Erfolgsquote pro Vorgang, Unterbrechungsfehler, Übergabequote, Kosten pro erledigter Aufgabe und fehlerhafte Aktionen. Klären Sie vorab, wo Audio und Transkripte verarbeitet werden, wie lange sie gespeichert bleiben, welche Unterauftragnehmer beteiligt sind und wann eine menschliche Freigabe erforderlich ist.

Die Beschaffungsfrage lautet damit nicht mehr nur: „Welche Stimme klingt natürlicher?“ Entscheidend ist, ob Gespräch, Backend-Aufgabe und Kontrollpfad unabhängig testbar sind — und ob ein abgebrochener Satz auch wirklich einen abgebrochenen Vorgang bedeutet.

## Quellen

- [Google — Gemini 3.8 Live und Live Extended Thinking](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/)
- [Google AI for Developers — Gemini 3.8 Live](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-live)
- [OpenAI — GPT-Live-1 in der API](https://openai.com/index/introducing-gpt-live-1-in-the-api/)
- [OpenAI Developers — Getting started with GPT-Live](https://developers.openai.com/api/docs/guides/live)
