LLM
Large Language Model (LLM) to program oparty na sztucznej inteligencji (AI), zaprojektowany do rozumienia i generowania ludzkiego języka. To „inteligentne” narzędzie tekstowe, które może odpowiadać na pytania, pisać artykuły, podsumowywać informacje i prowadzić rozmowy. Platformy generatywnej sztucznej inteligencji, takie jak ChatGPT, LLaMA i Gemini, używają LLM-ów do udzielania odpowiedzi przypominających wypowiedzi człowieka na monity użytkowników.
Jak działają LLM-y
LLM-y dzielą tekstowy dane wejściowe na mniejsze części zwane „tokenami”, które są słowami lub częściami słów. Następnie model używa złożonego systemu nazywanego siecią neuronową do analizowania tych tokenów i wyszukiwania wzorców oraz zależności na podstawie tego, czego „nauczył się” podczas procesu trenowania. LLM-y są trenowane na dużych ilościach tekstu z książek, artykułów i witryn internetowych. Model uczy się faktów, gramatyki i typowych sposobów porozumiewania się ludzi.
Gdy przekażesz LLM-owi monit, przewiduje on, jaki tekst powinien pojawić się dalej, słowo po słowie, wykorzystując poznane wzorce. Dzięki temu może generować zarówno krótkie odpowiedzi, jak i długie wypracowania, a nawet komputerowy kod źródłowy. Ze względu na przypominające ludzkie dane wyjściowe LLM-y są używane przez chatboty, wirtualnych asystentów, narzędzia do tłumaczenia i wiele innych aplikacji.
Co oznacza „duży” w nazwie LLM
Określenie „duży” w nazwie LLM odnosi się zarówno do ogromnej ilości tekstowych danych, na których trenowany jest model, jak i do ogromnej liczby parametrów znajdujących się w modelu — często liczonej w miliardach, a nawet bilionach. Parametry te pomagają modelowi podejmować decyzje dotyczące języka, ale wymagają też dużej mocy obliczeniowej.
LLM-y są potężne, ale mają też ograniczenia. Na przykład mogą popełniać błędy lub podawać nieprawdziwe informacje. Ich dane wyjściowe mogą również odzwierciedlać uprzedzenia obecne w danych treningowych. Dlatego warto sprawdzać ważne informacje otrzymane z usług generatywnej sztucznej inteligencji i weryfikować źródła użyte dla danych wyjściowych.
Sprawdź swoją wiedzę