Premier token
Mesurer routage, retrieval et modèle séparément; limiter outils et contexte au tour courant.
Qualification voix IA
Budgets par étage, dette du chemin Twilio et alternatives expérimentales sans les confondre avec une intégration production.
Les budgets de production restent à fixer par mesure. La conception expose chaque étage et privilégie une première phrase sûre.
Mesurer routage, retrieval et modèle séparément; limiter outils et contexte au tour courant.
Préparer une courte confirmation validée pendant que la réponse complète continue, sans anticiper une action critique.
Twilio actuel est final-only avec silence proche de 900 ms; ce seuil est un état de code, pas un SLO.
Double ffmpeg et upload complet sur le chemin actuel; le streaming reste shadow et ne doit pas être présenté comme production.
Une entrée de benchmark ne devient jamais un provider intégré.
| Niveau | Contenu | Preuve | Limite |
|---|---|---|---|
| État actuel | Chemin Twilio final-only, contrats STT/LLM/TTS et chaîne de providers configurable | Code et tests du dépôt | Aucun pipeline streaming voix souverain E2E |
| Cible | Endpoints cloud UE qualifiés, streaming annulable, identité/digest et budgets mesurés par étage | Contrats et gates seulement | Provider, modèle, capacité et SLO à figer |
| Alternatives TTS | Qwen registered voice et VoxCPM Nano décrits dans un harness cloud-only isolé | experiments/voice-human-lab, tests locaux du harness | Aucun provider contacté, aucun résultat qualité/latence, aucun import runtime |
| Choix LLM | Sélection ouverte derrière un contrat de proposition non autoritaire | Schémas, fallbacks et garde en code/tests | Aucun modèle/cloud déclaré production |
Le modèle ne reçoit aucune autorité métier. Les décisions et annulations sont décrites dans Pipeline technique.