Kai 2022 metais OpenAI paviešino ChatGPT, didžiųjų kalbos modelių industrija atrodė esanti uždaras klubas – ribotas skaičius didžiulių kompanijų, kurios turi išteklius treniruoti milžiniškus modelius. Per pastaruosius porą metų situacija radikaliai pasikeitė. Meta Llama, Mistral, DeepSeek, Qwen ir keletas kitų atvirojo kodo modelių 2026 metais pasiekia 90–95% komerciinių modelių kokybę už daugelio užduočių, o atrinktose srityse net juos pranoksta.
Verslui tai reiškia realią alternatyvą uždariems API. Open-source modelis gali būti talpinamas savo serveryje – tai šalina mėnesinę API mokesčio kainą, garantuoja duomenų neperdavimą trečioms šalims ir leidžia tiksliai pritaikyti (fine-tune) modelį konkretiems domeno duomenims. Vidutinio dydžio kompanijai, kuri šiandien moka 5–15 tūkst. eurų per mėnesį už OpenAI API, perėjimas į self-hosted Llama 3.3 ar Mistral Large gali sumažinti operatyvinę kainą per pusę po pirmųjų metų amortizacijos.
Tačiau tai NĖRA tinkamas sprendimas visiems. Open-source modeliai reikalauja infrastruktūros žinių – GPU serverio (paprastai nuo 1–4 A100 ar H100 GPU, kainuojančių 10–50 tūkst. eurų per metus išsinuomoti debesyje), modelio orchestracijos (vLLM, SGLang ar Ollama), monitoring'o ir versijų valdymo. Be techninės komandos šis kelias greitai tampa nuostolingas. Antra, naujausi closed-source modeliai (Claude 4.x, GPT-5) išlieka geriausi sudėtingiausiose agentinėse ir mąstymo užduotyse – ne kiekvienas verslo case'as pakenčia 5–10% kokybės sumažėjimą.
Praktinė architektūra 2026 metais dažnai yra hibridinė: kasdieniams, dažnai pasitaikantiems uždaviniams (klientų aptarnavimas, dokumentų santrauka, paprasti pokalbiai) – self-hosted open-source modelis; sudėtingoms užklausoms, reikalaujančioms aukščiausio kokybės lygio – išorinis komercinis API. Šis routing sluoksnis (paprastai įgyvendinamas kaip middleware) leidžia verslams gauti 70–80% kainos sutaupymo neprarandant kokybės ten, kur ji būtina.