ghostdrive1 commited on
Commit
cde8149
Β·
1 Parent(s): 3e62ed4

v26: voice __init__.py + requirements-voice.txt

Browse files
packages/voice/__init__.py CHANGED
@@ -1,10 +1,4 @@
1
- """packages/voice β€” Ultron V4 Voice Layer.
2
-
3
- Modules:
4
- stt.py β€” Whisper STT via Groq API (push-to-talk Discord audio -> text)
5
- tts.py β€” Kokoro TTS (text -> WAV bytes, CPU, ~0.3s for 100 tokens)
6
- pipeline.py β€” Discord audio pipeline: receive opus -> decode -> STT -> Brain -> TTS -> send WAV
7
-
8
- Target latency: <1.5s end-to-end.
9
- Separate HF Space (ultron-voice) in Phase 6.
10
- """
 
1
+ # packages/voice/__init__.py
2
+ # Ultron V4 β€” Voice package
3
+ # Server: packages/voice/server.py (FastAPI, Groq Whisper STT + Kokoro TTS)
4
+ # Deploy: docker/ultron-voice.Dockerfile
 
 
 
 
 
 
requirements-voice.txt ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # requirements-voice.txt
2
+ # Ultron V4 β€” Voice Space dependencies
3
+ # Deploy: docker/ultron-voice.Dockerfile (separate HF Space from Brain)
4
+ # Install: pip install -r requirements-voice.txt
5
+
6
+ # Web framework
7
+ fastapi>=0.110.0
8
+ uvicorn[standard]>=0.29.0
9
+
10
+ # HTTP client (Brain /infer calls, health checks)
11
+ httpx>=0.27.0
12
+
13
+ # Groq SDK (Whisper STT β€” POST /stt)
14
+ groq>=0.5.0
15
+
16
+ # Kokoro TTS (POST /tts)
17
+ # PyPI: https://pypi.org/project/kokoro/
18
+ kokoro>=0.9.2
19
+
20
+ # Audio processing (numpy for raw PCM ops if needed by Kokoro)
21
+ numpy>=1.26.0
22
+
23
+ # Pydantic v2 (FastAPI models)
24
+ pydantic>=2.6.0
25
+
26
+ # python-multipart (FastAPI file upload β€” /stt receives audio bytes)
27
+ python-multipart>=0.0.9