← Studii de caz

Servicii profesionale · Program de sustenabilitate și pregătire digitală · 4 februarie 2026

Sistem de Evaluare cu LLM Privat

Modele private fine-tuned pentru evaluări structurate — pipeline-uri de instruire, implementare GGUF/Ollama și un API pentru integrare de produs.

Rezultate obținute

Confidențialitate

Inferență privată

Conținutul de evaluare rămâne în runtime-ul controlat.

Adaptare

Fine-tuning pe domeniu

Modele instruite pentru sarcina de evaluare, nu chat generic.

Integrare

Servit prin API

Produsele consumă inferență fără să dețină operarea ML.

Context

Atunci când răspunsurile sunt confidențiale, modelul trebuie să trăiască acolo unde politica de date permite.

Provocare

Fluxurile de evaluare aveau nevoie de asistență din partea unui model de limbaj, fără a trimite răspunsuri organizaționale sensibile către API-uri LLM publice. Modelele standard erau generice; produsul avea nevoie de comportament ajustat pe domeniu și de un traseu de inferență implementabil.

Abordare

Am construit pipeline-uri de instruire în Python (pregătire Excel/date → fine-tuning transformers/LoRA), am exportat artefacte GGUF, am ambalat modele compatibile Ollama și am expus un API de inferență Express/Ollama pentru aplicații. Docker cu CUDA a susținut iterațiile de instruire.

Arhitectură

Joburi de instruire PyTorch/transformers, export llama.cpp/GGUF, runtime Ollama, API de inferență Node/Express, Docker cu suport CUDA pentru fine-tuning.

Domeniu

  • Pregătirea seturilor de date
  • Fine-tuning LoRA
  • Export model
  • Servire locală/privată
  • API de inferență de produs

Constrângeri

  • Fără dependență de furnizori LLM publici pentru inferență
  • Disponibilitate GPU pentru ciclurile de instruire
  • Nevoia unei serviri operațional simple, după instruire

Aspecte cheie ale soluției

  • LoRA pentru adaptare eficientă pe domeniu
  • GGUF/Ollama pentru implementare privată practică
  • API minimal între operarea modelului și UX-ul de produs

Tehnologii

PythonPyTorchTransformersLoRAllama.cppOllamaNode.jsDockerCUDA

Rezultate

  • Ciclu repetabil de fine-tuning → export → servire
  • Inferență privată potrivită pentru conținut de evaluare sensibil
  • Limită API astfel încât produsele nu integrează complexitatea de instruire
  • Puncte de control documentate pentru îmbunătățirea iterativă a modelului

Lecții învățate

  • Fine-tuning-ul fără un traseu de export/servire este cercetare, nu produs.
  • LLM-urile private au încă nevoie de evaluare — confidențialitatea nu înseamnă calitate.
  • Ține drama de instruire în afara traseului de cerere.

Să discutăm

Ești pregătit să construiești ceva durabil?

Colaborează cu o echipă de ingineri seniori care proiectează, livrează și operează software pe care afacerile se bazează ani la rând.

Contactează-ne