OpenAI a présenté le GPT‑Realtime‑2 et deux nouvelles variantes vocales disponibles uniquement via l’API
OpenAI étend les capacités de son API vocal
La société a annoncé le lancement de nouvelles fonctionnalités pour son API, permettant aux développeurs de créer des applications vocales plus « vivantes » : ils pourront dialoguer avec les utilisateurs, transcrire la parole en texte et traduire les conversations en temps réel.
Nouveaux modèles Realtime
Via l’interface Realtime, trois modèles sont désormais disponibles :
| Modèle | Destinée | Caractéristiques clés |
|---|---|---|
| GPT‑Realtime‑2 | Interaction vocale en temps réel | Analyse des requêtes, appel d'outils, traitement des corrections et continuation fluide du dialogue. Basé sur la logique GPT‑5, il permet de gérer des tâches plus complexes que GPT‑Realtime‑1.5. |
| GPT‑Realtime‑Translate | Traduction en temps réel | Prend en charge 70+ langues d’entrée et 13 langues de sortie. Conserve le sens même avec un changement de contexte, d’accent régional ou de terminologie spécialisée. |
| GPT‑Realtime‑Whisper | Transcription vocale | Modèle à faible latence qui convertit l’audio en texte presque instantanément. |
> « Nos nouveaux modèles traduisent l'audio en temps réel depuis une simple conversation vers des interfaces vocales capables d’écouter, de raisonner, de traduire, de transcrire et d’agir au fur et à mesure que la discussion évolue », a déclaré la société.
Tarifs
Modèle | Prix
---|---
GPT‑Realtime‑2 | 32 $ pour 1 million de tokens audio entrants, 0,40 $ pour 1 million de tokens mis en cache et 64 $ pour 1 million de tokens audio sortants
GPT‑Realtime‑Translate | 0,034 $ par minute
GPT‑Realtime‑Whisper | 0,017 $ par minute
Comment essayer
Les développeurs peuvent tester les nouveaux modèles sur la plateforme en ligne OpenAI Playground et voir immédiatement comment ils fonctionnent en temps réel.
Commentaires (0)
Partagez votre avis — merci de rester courtois et dans le sujet.
Connectez-vous pour commenter