> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-docs-responses-api.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Speech-to-Text-Modelle

> Venice-Speech-to-Text-Modelle wie Whisper Large V3 und ElevenLabs Scribe mit mehrsprachiger Unterstützung, Zeitstempeln und Preisen pro Sekunde.

<div id="model-search-placeholder" data-filter="asr">
  Verwenden Sie den `id`-Wert als `model`-Parameter in API-Anfragen. Derzeit sind 5 Modelle verfügbar.

  | Model | ID | Pro Audio-Sekunde | Privacy |
  | - | - | - | - |
  | ElevenLabs Scribe V2 | `elevenlabs/scribe-v2` | \$0.0002 | Anonymized |
  | Parakeet ASR | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001 | Private |
  | Whisper Large V3 | `openai/whisper-large-v3` | \$0.0001 | Private |
  | Wizper (Whisper v3) | `fal-ai/wizper` | \$0.0001 | Private |
  | xAI Speech to Text v1 | `stt-xai-v1` | \$0.0000 | Anonymized |
</div>

***

## Verwendung

Speech-to-Text-Modelle transkribieren gesprochenes Audio in geschriebenen Text. Sie werden über die [Audio-Transcriptions-API](/de/api-reference/endpoint/audio/transcriptions) aufgerufen.

### Unterstützte Audioformate

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

Eine Datei wird akzeptiert, wenn entweder ihr MIME-Typ oder ihre Dateiendung auf dieser Liste steht, und sie muss zusätzlich einen Magic-Byte-Check der hochgeladenen Bytes bestehen. Das bloße Umbenennen einer Datei auf eine unterstützte Endung reicht nicht aus.

### Antwortformate

| Format | Beschreibung |
| - | - |
| `json` | Standard. Gibt `{ "text": "..." }` zurück, plus `duration` und `timestamps`, sofern verfügbar. |
| `text` | Reiner transkribierter Text. |

### Timestamps

Setzen Sie `timestamps: true`, um Timing-Daten zusammen mit dem Transkript zu erhalten. Die Antwort enthält dann ein `timestamps`-Objekt, dessen Granularität vom Modell abhängt:

| Modell | Granularität |
| - | - |
| `elevenlabs/scribe-v2` | `word` |
| `stt-xai-v1` | `word` |
| `openai/whisper-large-v3` | `segment` |
| `fal-ai/wizper` | `segment` |
| `nvidia/parakeet-tdt-0.6b-v3` | Keine |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` ist das Standardmodell, und es akzeptiert `timestamps: true`, ohne Timings zurückzugeben. Es gibt keinen Fehler und keine Warnung – die Antwort enthält einfach nur `text` und sonst nichts. Wenn Sie Timings benötigen, wählen Sie ein Modell aus der Tabelle oben und prüfen Sie, ob der Schlüssel `timestamps` vorhanden ist, bevor Sie ihn auslesen.
</Warning>

Word-Einträge sind `{ "word": "...", "start": 0.0, "end": 0.5 }` und Segment-Einträge sind `{ "text": "...", "start": 0.0, "end": 3.2 }`, wobei alle Zeiten in Sekunden angegeben sind.

<Note>
  Die Abrechnung erfolgt pro Sekunde Eingabe-Audio. Anfrage-Beispiele und Parameterdetails finden Sie in der [Audio-Transcriptions-API](/de/api-reference/endpoint/audio/transcriptions).
</Note>


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.