> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-docs-responses-api.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Rate limit

> Rate limit dell'API Venice per tier, gli header che espongono la capacità e la gestione delle risposte 429.

I rate limit variano in base al modello e al tier. I limiti predefiniti qui sotto sono un riferimento utile, ma l'endpoint API `/api_keys/rate_limits` è il modo canonico per ottenere i tuoi limiti correnti. Puoi controllare i tuoi limiti esatti in qualsiasi momento:

<CardGroup cols={2}>
  <Card title="Visualizza i tuoi limiti" icon="gauge-high" href="/it/api-reference/endpoint/api_keys/rate_limits?playground=open">
    Playground interattivo
  </Card>

  <Card title="Log dei rate limit" icon="clock-rotate-left" href="/it/api-reference/endpoint/api_keys/rate_limit_logs?playground=open">
    Scopri quali richieste hanno raggiunto i limiti
  </Card>
</CardGroup>

```bash theme={null}
curl https://api.venice.ai/api/v1/api_keys/rate_limits \
  -H "Authorization: Bearer $VENICE_API_KEY"
```

## Limiti predefiniti

### Modelli di testo ed embedding

I modelli di testo ed embedding sono raggruppati in quattro dimensioni. Ogni card di modello sulla [pagina Modelli](/it/models/text) mostra il badge della propria dimensione. Tutti i modelli di embedding sono XS.

| Dimensione | Richieste/min | Token/min | Richieste/min partner | Token/min partner |
| :- | -: | -: | -: | -: |
| XS | 500 | 5.000.000 | 500 | 10.000.000 |
| S | 150 | 3.000.000 | 300 | 6.000.000 |
| M | 100 | 2.000.000 | 200 | 4.000.000 |
| L | 100 | 2.000.000 | 150 | 3.000.000 |

<Note>
  Alcuni modelli funzionano su infrastruttura dedicata o di terze parti e hanno limiti che non corrispondono a queste quattro dimensioni. Chiama [`GET /api_keys/rate_limits`](/it/api-reference/endpoint/api_keys/rate_limits) per i limiti autorevoli per modello sulla tua chiave.
</Note>

### Modelli di immagini e audio

| Tipo | Richieste/min | Richieste/min partner |
| :- | -: | -: |
| Immagini, upscale, inpaint | 20 | 60 |
| Voce e trascrizione | 60 | 120 |

### Modelli video e musicali

I job video, musica e voice-changer non sono soggetti a rate limit. Vengono fatturati per generazione sul tuo saldo di crediti, quindi il vincolo pratico è il costo piuttosto che un tetto di richieste. Stima prima il prezzo di un job con [`POST /video/quote`](/it/api-reference/endpoint/video/quote), [`POST /audio/quote`](/it/api-reference/endpoint/audio/quote) o [`POST /audio/voice-changer/quote`](/it/api-reference/endpoint/audio/voice-changer/quote).

## Gestione degli errori

Le richieste fallite (500, 503, 429) dovrebbero essere ritentate con backoff esponenziale.

Per gli errori 429 specificamente, controlla l'header `x-ratelimit-reset-requests` per il timestamp Unix esatto in cui puoi riprovare. La maggior parte delle librerie HTTP dispone di meccanismi di retry integrati che gestiscono questo automaticamente.

### Budget di errore

Due ulteriori limiti proteggono l'API dai client che continuano a ritentare contro un muro. Entrambi vengono conteggiati per modello e per chiave API su una finestra mobile di 30 secondi, ed entrambi restituiscono `429`:

| Budget | Soglia | Si applica a |
| :- | -: | :- |
| Richieste fallite | 50 ogni 30 s | Tutti gli endpoint |
| Richieste di funzionalità non supportate | 200 ogni 30 s | `/chat/completions`, `/responses` |

Il secondo budget conteggia le richieste che chiedono a un modello una funzionalità che non supporta, ad esempio richiedere visione o tool calling a un modello privo di tale capacità. Il superamento di uno dei due budget appare nei [log dei rate limit](/it/api-reference/endpoint/api_keys/rate_limit_logs) come `FAILED_REQUESTS` o `UNSUPPORTED_FEATURE_REQUESTS`.

Entrambi restituiscono un `customMessage` che indica la soglia superata:

```
Too many failed attempts (> 50) resulting in a non-success status code. Please wait 30 seconds and try again. See https://docs.venice.ai/api-reference/rate-limiting for more information.
```

Queste risposte impostano `x-ratelimit-remaining` e `x-ratelimit-resets` invece degli header per finestra descritti qui sotto.

## Response headers

Ogni risposta include questi header:

| Header | Descrizione |
| :- | :- |
| `x-ratelimit-limit-requests` | Numero massimo di richieste consentite nella finestra corrente |
| `x-ratelimit-remaining-requests` | Richieste rimanenti nella finestra corrente |
| `x-ratelimit-reset-requests` | Timestamp Unix quando la finestra si resetta |
| `x-ratelimit-limit-tokens` | Numero massimo di token consentiti al minuto |
| `x-ratelimit-remaining-tokens` | Token rimanenti nel minuto corrente |
| `x-ratelimit-reset-tokens` | Secondi al reset del limite di token |

L'endpoint `/crypto/rpc/{network}` usa limiti propri e i propri header `X-RateLimit-Limit`, `X-RateLimit-Remaining` e `X-RateLimit-Reset`, che vengono impostati solo sulle risposte 429. Vedi [Crypto RPC](/it/api-reference/endpoint/crypto/rpc) per i dettagli.

## Tier Partner

I limiti partner sono elencati accanto ai limiti predefiniti nelle tabelle qui sopra.

Se raggiungi costantemente i tuoi rate limit e i tuoi pattern di utilizzo mostrano una **domanda sostenuta nel tempo**, contattaci per discutere l'accesso partner: [api@venice.ai](mailto:api@venice.ai).

I limiti del tier partner possono essere regolati in base alle tue esigenze specifiche.


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.