File size: 2,291 Bytes
c41750d
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
# Servidor

Esta p谩gina cubre la inferencia del lado del servidor para Fish Audio S2, adem谩s de enlaces r谩pidos para la inferencia con WebUI y el despliegue con Docker.

## Inferencia del servidor API

Fish Speech proporciona un punto de entrada de servidor HTTP en `tools/api_server.py`.

### Iniciar el servidor localmente

```bash
python tools/api_server.py \
  --llama-checkpoint-path checkpoints/s2-pro \
  --decoder-checkpoint-path checkpoints/s2-pro/codec.pth \
  --listen 0.0.0.0:8080
```

Opciones comunes:

* `--compile`: habilitar optimizaci贸n con `torch.compile`
* `--half`: usar modo fp16
* `--api-key`: requerir autenticaci贸n mediante bearer token
* `--workers`: establecer la cantidad de procesos worker

### Verificaci贸n de estado (health check)

```bash
curl -X GET http://127.0.0.1:8080/v1/health
```

Respuesta esperada:

```json
{"status":"ok"}
```

### Endpoint principal de la API

* `POST /v1/tts` para generaci贸n de texto a voz (text-to-speech)
* `POST /v1/vqgan/encode` para codificaci贸n VQ
* `POST /v1/vqgan/decode` para decodificaci贸n VQ

### Ejemplo de cliente en Python

El modelo base de TTS se selecciona al iniciar el servidor. En el ejemplo anterior, el servidor se inicia con los pesos `checkpoints/s2-pro`, por lo que cada request enviada a `http://127.0.0.1:8080/v1/tts` usar谩 **S2-Pro** autom谩ticamente. No existe un campo `model` por request en `tools/api_client.py` para llamadas al servidor local.

```bash
python tools/api_client.py \
  --url http://127.0.0.1:8080/v1/tts \
  --text "Hello from Fish Speech" \
  --output s2-pro-demo
```

Si quieres seleccionar una voz de referencia guardada, usa `--reference_id`. Esto elige la **referencia de voz**, no el modelo base TTS:

```bash
python tools/api_client.py \
  --url http://127.0.0.1:8080/v1/tts \
  --text "Hello from Fish Speech" \
  --reference_id my-speaker \
  --output s2-pro-demo
```

## Inferencia con WebUI

Para uso con WebUI, ver:

* [WebUI Inference](https://speech.fish.audio/inference/#webui-inference)

## Docker

Para despliegue del servidor o WebUI basado en Docker, ver:

* [Docker Setup](https://speech.fish.audio/install/#docker-setup)

Tambi茅n puedes iniciar directamente el perfil del servidor con Docker Compose:

```bash
docker compose --profile server up
```