Latence et budgets

Les budgets de production restent à fixer par mesure. La conception expose chaque étage et privilégie une première phrase sûre.

TTFT

Premier token

Mesurer routage, retrieval et modèle séparément; limiter outils et contexte au tour courant.

Première phrase sûre

Réponse immédiate

Préparer une courte confirmation validée pendant que la réponse complète continue, sans anticiper une action critique.

Fin de parole

Détection de tour

Twilio actuel est final-only avec silence proche de 900 ms; ce seuil est un état de code, pas un SLO.

Dette connue

Chemin audio Twilio

Double ffmpeg et upload complet sur le chemin actuel; le streaming reste shadow et ne doit pas être présenté comme production.

État, cible et alternatives IA

Une entrée de benchmark ne devient jamais un provider intégré.

NiveauContenuPreuveLimite
État actuelChemin Twilio final-only, contrats STT/LLM/TTS et chaîne de providers configurableCode et tests du dépôtAucun pipeline streaming voix souverain E2E
CibleEndpoints cloud UE qualifiés, streaming annulable, identité/digest et budgets mesurés par étageContrats et gates seulementProvider, modèle, capacité et SLO à figer
Alternatives TTSQwen registered voice et VoxCPM Nano décrits dans un harness cloud-only isoléexperiments/voice-human-lab, tests locaux du harnessAucun provider contacté, aucun résultat qualité/latence, aucun import runtime
Choix LLMSélection ouverte derrière un contrat de proposition non autoritaireSchémas, fallbacks et garde en code/testsAucun modèle/cloud déclaré production