Similar presentations:
Великі тілдік модельдер (LLM): кіріспе және қолдану
1. Дәріс 3
Үлкен тілдік модельдер (LLM). Үлкен тілдік модельдерге кіріспе.LLM-ді мәтін генерациялау және жинақтау үшін пайдалану.
2. Үлкен тілдік модельдер
Үлкентілдік
модельдер
(LLM) – адам тілін түсіну,
өңдеу және генерациялау үшін
мәтіндік деректердің үлкен
көлеміне үйретілген жасанды
интеллект модельдері. Олар
миллиардтаған
параметрлерден
тұратын
нейрондық желілер негізінде
жұмыс
істейді
және
трансформер архитектурасы
арқылы сөздер арасындағы
байланыстарды талдайды.
3.
4. Multi-head attention
5. LLM моделінің өлшем параметрлері оның өнімділігі туралы не айтады
• LLM моделінің өлшемі - бұл модель тілді өңдеу және жасау үшінпайдаланатын параметрлердің жалпы саны.
• LLM моделінің өлшемі модельдің тілді өңдеу және жасау үшін
пайдаланатын параметрлер санымен анықталады. Әрбір
параметр - үйренілген тілдік үлгілерді көрсету үшін LLM
оқыту кезінде түзетілген сандық салмақ . Параметрлердің жалпы
саны модельдің қанша ақпарат сақтай алатынын және контекстті
қаншалықты
тиімді
түсінетінін
немесе
ойлау
тапсырмаларын қаншалықты тиімді орындай алатынын
анықтайды .
6. LLM моделінің өлшем параметрлері оның өнімділігі туралы не айтады
7. LLM моделінің өлшемдерін салыстыру (2025)
• LLM моделінің өлшемдерін салыстыру параметрлер саны мен жад ізініңархитектуралар бойынша қалай масштабталатынын көрсетеді. Келесі кестеде
FP16 және INT8 дәлдік форматтарындағы танымал модельдердің шамамен
өлшемдері көрсетілген.
• Бұл бағалаулар жалпыға қолжетімді деректерге және орналастыру үшін
қолданылатын жалпы кванттау деңгейлеріне негізделген.
• LLM өлшемдерін салыстыру параметрлер саны мен жад ізінің модель
архитектуралары бойынша қалай масштабталатынын көрсетеді. Төмендегі LLM
моделінің өлшем кестесінде жиі қолданылатын модельдер және олардың FP16
және INT8 дәлдігі бойынша шамамен сақтау қажеттіліктері қорытындыланған.
Бұл мәндер орналастыруда қолданылатын жалпы деректер мен стандартты
кванттау әдістеріне негізделген.
• Жаңартылған LLM өлшем кестесі инженерлерге оқыту немесе орналастыру
алдында қай модельдің GPU жадына сәйкес келетінін тез бағалауға
көмектеседі.
• Іс жүзінде, 7B және 13B параметрлері арасындағы модельдер жергілікті және
кәсіпорын деңгейіндегі дәл баптау үшін ең тиімді ортаңғы деңгейді білдіреді.
70B және одан жоғары сияқты үлкенірек архитектуралар негізінен жоғары
сыйымдылықты GPU қолжетімді бұлтқа негізделген қорытынды немесе
зерттеу орталарында қолданылады.
8. LLM моделінің өлшемдерін салыстыру кестесі (2025)
9. LLM өлшемі мен өнімділігі: тепе-теңдікті табу
• LLM өнімділігі өлшемге байланысты өзгереді, бірақ байланыссызықтық емес. Параметрлер санының артуы ойлауды, түсінуді және
жалпылауды белгілі бір деңгейге дейін жақсартады, содан кейін
өнімділік артуы азаяды, ал есептеу және энергия шығындары күрт
артады.
• 3 миллиард LLM параметрлерінен аз модельдер сияқты кішігірім
модельдер мәтінді жіктеудің және сезім талдауының негізгі әдістерін
өңдейді, бірақ көбінесе көп сатылы ойлау тапсырмаларында
сәтсіздікке ұшырайды. 7B және 13B параметрлері арасындағы
модельдер жылдамдық, дәлдік және шығындар тиімділігінің мықты
тепе-теңдігін қамтамасыз етеді. 70B параметрлерінен тыс өнімділік
жақсаруы есептеу мен кідірістің күрт өсуімен салыстырғанда біртіндеп
артады.
10.
LLM өлшемі мен өнімділігі: тепе-теңдікті табу11. LLM галлюцинацияларының түрлері
• Табиғи тілді өңдеу (ТТӨ)саласында
галлюцинация - бұл
модель жасаған мәтін
мағынасыз немесе
берілген контекстке
сәйкес келмейтін
құбылыс. ТТӨ-де
галлюцинациялар әдетте
екі негізгі түрге бөлінеді:
• шындыққа жанасатын
галлюцинациялар;
• адалдық
галлюцинациялары.
12.
• Фактілік галлюцинациялар шындықтағы қателіктерді немесежалған ақпараттың пайда болуын қамтиды. Оларды екі кіші
түрге бөлуге болады:
• Оңай тексеріліп және жоққа шығарылатын фактілердегі
қателіктер. Мысалы, «Ғарышқа ұшқан алғашқы адам кім
болды?» деген сұраққа модель «Нил Армстронг» деп жауап
беруі мүмкін, бірақ дұрыс жауап «Юрий Гагарин» болуы мүмкін.
• Нақты деректермен расталмайтын ойдан шығарылған фактілер.
Мысалы,
«Джеймс
Кэмеронның
«Титаникі»
адамзат
тарихындағы ең маңызды фильм болып саналады» деген
тұжырым
субъективті
және
ешқандай
объективті
дереккөздермен расталмайды.
13.
• Шындық галлюцинациялары, өз кезегінде, логиканың, контексттің немесенұсқаулардың бұзылуымен байланысты. Олар сондай-ақ кіші түрлерге бөлінеді:
• Нұсқауларды орындамау, егер модель пайдаланушының нақты сұраныстарын
елемесе. Мысалы, егер сұраныс орыс тілінде жасалса және модель ағылшын тілінде
жауап берсе.
• Мәтінмәндік сәйкессіздік, ол өңдеу кезінде мәтіннің мағынасының бұрмалануында
көрінеді. Мысалы, қорытындылаған кезде, түпнұсқа мәтіндегі «Сауалнама
респонденттердің 70%-ы жаңартылатын энергия көздеріне көшуді қолдайтынын
көрсетті, бірақ тек 40%-ы ғана таза энергия үшін көбірек төлеуге дайын» дегенді
«Респонденттердің көпшілігі (70%) таза энергия үшін көбірек төлеуге дайын» деп
қысқартуға болады.
• Логикалық сәйкессіздік ойлау есептерінде модель ойлау қадамдары мен соңғы
қорытынды арасында қайшылықтар көрсеткен кезде пайда болады. Мысалы,
«Барлық мысықтар сүтқоректілер . Кейбір сүтқоректілер ұша алады. Демек, кейбір
мысықтар ұша ала ма?» деген сұраққа модель былай деп жауап беруі мүмкін:
• «Мысықтар сүтқоректілер (дұрыс).»
• «Кейбір сүтқоректілер, мысалы, жарқанаттар (дұрыс) ұшады».
• «Сонымен, кейбір мысықтар да ұшады (жалған).»
• Бұл жағдайда логикалық қателік орын алады: пайымдау қадамдары алынған
қорытындыға әкелмейді, бұл модельдің ішкі сәйкессіздігін көрсетеді.
14. Prompt Engineering
- бұл үлкен тілдік модельдерден (LLM, мысалы, GPT-4, GigaChat) дәл жәнежоғары сапалы жауаптар алу үшін сұраныстарды (сұрауларды) әзірлеу,
оңтайландыру және құрылымдау саласы. Бұл тек ботпен әңгімелесу ғана
емес, сонымен қатар инженерлік тәсіл: жасанды интеллекттің мінезқұлқын басқару үшін контекстті, рөлдерді, нұсқауларды және мысалдарды
пайдалану.
Тиімді промттың негізгі компоненттері:
•Нұсқаулық: Анық тапсырма (мысалы, «жаз», «аудар», «қорытынды
жасау»).
•Контекст: Модельге шектеулерді түсінуге көмектесетін фондық ақпарат.
•Рөл: Рөлді тағайындаңыз (мысалы, «Тәжірибелі маркетолог сияқты әрекет
етіңіз»).
•Шығыс форматы: Құрылымды көрсету (кесте, тізім, JSON, эссе)
.Қысқаша нұсқау: Қажетті жауаптардың мысалдары.
pedagogy