← Studii de caz

AI · Echipă de produs pentru tehnologie lingvistică · 13 mai 2026

Asistent Vocal Edge pe CPU

Pipeline vocal românesc doar pe CPU — Whisper STT, LLM local GGUF, Piper TTS — servit prin WebSocket, cu bootstrap dockerizat al modelelor.

Rezultate obținute

Hardware

Capabil pe CPU

Funcționează fără o presupunere obligatorie de GPU.

Limbă

Pregătit pentru română

Alegerile STT/TTS se aliniază cu audiența.

Integrare

API WebSocket

Produsele pot integra curat ciclul vocal.

Context

Acoperirea lingvistică și confidențialitatea contează adesea mai mult decât viteza maximă de tokeni/sec, pentru asistenții locali.

Provocare

Asistenții vocali presupun de obicei GPU-uri sau STT/LLM/TTS în cloud. Cerința era un ciclu vocal românesc funcțional pe CPU, în privat, cu un API WebSocket simplu și un UI de test.

Abordare

Am ambalat STT faster-whisper (inclusiv conversie CTranslate2 pentru ponderile Whisper regionale), inferență LLM GGUF llama.cpp, TTS românesc Piper și un endpoint vocal WebSocket FastAPI. Joburile de inițializare Docker Compose descarcă/convertesc modele în volume, la prima pornire.

Arhitectură

Serviciu vocal WebSocket FastAPI, STT faster-whisper, LLM llama.cpp, TTS Piper, volume de model Docker Compose și convertoare de inițializare.

Domeniu

  • Recunoaștere vocală
  • Ture LLM locale
  • Sintetizare vocală
  • API WebSocket
  • Bootstrap de model

Constrângeri

  • Bugete de latență pe CPU
  • Dimensiunea descărcării modelului
  • Conversie transformers→CTranslate2 pentru variantele Whisper

Aspecte cheie ale soluției

  • Containere de inițializare pentru conversia de model o singură dată
  • GGUF instruct mic, pentru practicitate pe CPU
  • Protocol WebSocket minimal pentru clienți

Tehnologii

FastAPIfaster-whisperllama.cppPiper TTSDockerWebSocketPython

Rezultate

  • Ciclu STT→LLM→TTS de la un cap la altul, pe CPU
  • Traseu de sintetizare și recunoaștere vocală orientat spre română
  • API WebSocket pentru integrare de produs
  • Descărcare/conversie automată de model la compose up

Lecții învățate

  • Stivele vocale sunt probleme de operare a modelelor, la fel de mult ca probleme de ML.
  • Conversia de format ar trebui automatizată, nu doar documentată în README ca folclor.
  • Asistenții pe CPU au nevoie de disciplină riguroasă privind dimensiunea modelului.

Să discutăm

Ești pregătit să construiești ceva durabil?

Colaborează cu o echipă de ingineri seniori care proiectează, livrează și operează software pe care afacerile se bazează ani la rând.

Contactează-ne