• 베스트
  • 소득공제
  • 무료배송

자연어 처리를 위한 허깅페이스 트랜스포머 하드 트레이닝 - 코드와 결과물로 이해하는 언어 모델과 트랜스포머

  • 박성환, 남승우
  • 비제이퍼블릭
  • 2025년 01월 13일
사용자 평점
0리뷰 0개
10%24,75027,500원
적립금
1,370원 (5% 적립)
추가 적립 안내
  • 5만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

  • 10만원 이상 결제 시 (*배송비 제외)

    정가제FREE(상품/사은품) 금액이
    2,000원 이상이면 2,000원 추가적립

    정가제FREE(상품/사은품) 금액이
    5,000원 이상이면 5,000원 추가적립

회원가입 시 적립금 즉시 지급!

배송비
무료 (해외배송의 경우 지역에 따라 상이)

배송안내

배송비 안내
  • 1만원 이상 주문 시 무료배송 입니다.
  • 주문하신 상품을 해외로 배송 하시는 경우에는 별도의 항공료 가 부과됩니다
서울특별시 강남구 강남대로 542(논현동, 영풍빌딩)
주문 수량 변경시 안내

[주문/배송] 주문 수량 변경 시 안내

주문 수량 변경 시,배송일정이 변경될 수 있으니 반드시 확인해 주시기 바랍니다.
(고객센터 1544-9020)

지금 주문하면 9/15(화) 출고 가능
택배보다 빠른, 나우드림
상품 규격 정보
상품상세정보
ISBNISBN-13 : 9791165923150
쪽수320쪽
크기기타 규격
제품구성단행본
이 책이 속한 분야
  • 컴퓨터/IT > 시스템공학
관련 이벤트

AI추천 이유

책 소개

자연어 처리의 기본부터

허깅페이스 모델 경량화, 정렬 조정, 강화 학습까지

GPT와 같은 대화형 인공지능 챗봇과 다수의 오픈소스 생성형 언어 모델은 대규모 언어 모델(LLM)에 해당합니다. 허깅페이스는 각종 생성형 인공지능을 위한 모델과 데이터셋을 개발자들이 자유롭게 공유하고 쉽게 활용할 수 있도록 API 및 도구를 제공하는데, 『자연어 처리를 위한 허깅페이스 트랜스포머 하드 트레이닝』에서는 다양한 생성형 인공지능 기술 중 자연어 처리를 위한 언어 모델에 집중합니다.

 

Transformers 라이브러리를 기준으로 토크나이저 및 모델 준비, 한국어 자연어 이해 평가(KLUE) 데이터셋 전처리, 학습 파라미터 선정 및 학습 진행과 성능 평가를 실습해봅니다. 이후 사전학습 단계부터 직접 진행해야 하는 경우를 대비하여 Tokenizers 라이브러리에 대해 살펴보고 정확도, f1 스코어, 정밀도, 재현율을 기준으로 모델을 평가하는 Evaluate 라이브러리에 대해서 알아봅니다. PEFT, 양자화, QLoRA 미세조정과 같이 모델의 메모리 사용량은 줄이고 추론 속도는 높이는 경량화 기법에 대해 코드와 결과물로 꼼꼼하게 확인해본 후 RLHF, SFT, PPO, Best-of-N 샘플링 등 정렬 조정에 해당하는 다양한 방법론과 이를 강화학습을 위한 트랜스포머(TRL)를 통해 활용하는 방식까지 차근차근 학습합니다.

목차

[목 차]
  

1 자연어 처리와 허깅페이스

_1.1 허깅페이스 소개

__1.1.1 Datasets

__1.1.2 Models

__1.1.3 Spaces

__1.1.4 Docs

_1.2 자연어 처리와 허깅페이스의 관계

 

2 환경 구축

_2.1 구글 코랩 환경 구축

__2.1.1 계정 생성

__2.1.2 새 노트북 만들기

__2.1.3 코드 실행

__2.1.4 파일 저장

__2.1.5 깃 코드 열기

_2.2 구글 드라이브 마운트

 

3 허깅페이스 주요 라이브러리

_3.1 Datasets 라이브러리

__3.1.1 Datasets 설치

__3.1.2 Datasets 실습

_3.2 Transformers 라이브러리

__3.2.1 Transformers 설치

__3.2.2 Tokenizer

__3.2.3 DataCollator

__3.2.4 Model

__3.2.5 AutoClass

__3.2.6 Trainer, TrainingArguments

__3.2.7 Pipeline

_3.3 미세조정

__3.3.1 토크나이저와 모델 준비

__3.3.2 데이터 준비 및 전처리

__3.3.3 학습 파라미터 선정

__3.3.4 학습 진행

__3.3.5 성능 평가

__3.3.6 모델 저장

_3.4 허깅페이스 허브 등록

__3.4.1 push_to_hub()

__3.4.2 CLI

__3.4.3 huggingface-hub

 

4 보조 라이브러리

_4.1 Tokenizers 라이브러리

__4.1.1 Tokenizer 학습

__4.1.2 모델 초기화 후 학습

_4.2 Evaluate 라이브러리

__4.2.1 Evaluate 평가

__4.2.2 커스텀 메트릭 만들기

__4.2.3 Trainer 적용

 

5 언어 모델 구조 및 학습

_5.1 트랜스포머 모델

_5.2 인코더 기반 모델

__5.2.1 기본 구조

__5.2.2 Sequence Classification

__5.2.3 Multiple Choice

__5.2.4 Token Classification

__5.2.5 Question Answering

_5.3 디코더 기반 모델

__5.3.1 기본 구조

__5.3.2 Causal LM

__5.3.3 Question Answering

__5.3.4 Sequence Classification

_5.4 인코더-디코더 기반 모델

__5.4.1 기본 구조

__5.4.2 Conditional Generation

__5.4.3 Sequence Classification

__5.4.4 Question Answering

 

6 모델 활용

_6.1 모델 미세조정

__6.1.1 인코더 - Sequence Classification

__6.1.2 디코더 - Causal LM

__6.1.3 인코더-디코더 - Conditional Generation

__6.1.4 언어 모델 문장 생성

_6.2 모델 서빙

 

7 모델 경량화

_7.1 모델 경량화 개요

_7.2 PEFT

_7.3 양자화

_7.4 QLoRA 미세조정

 

8 TRL

_8.1 TRL 라이브러리 개요

_8.2 RLHF

_8.3 보상 모델 트레이닝

_8.4 SFT

_8.5 PPO

_8.6 Best-of-N 샘플링

_8.7 DPO

_8.8 KTO

_8.9 CPO

_8.10 ORPO

출판사 서평



추론 속도를 높이고 성능을 발전시키는

허깅페이스 라이브러리 하드 트레이닝

 

1장에서는 허깅페이스 허브에 등록된 모델 및 데이터셋을 확인해보고 자연어 처리와 허깅페이스의 관계에 대해 알아봅니다.

 

2장에서는 허깅페이스를 하드 트레이닝해보기에 앞서 구글 코랩 환경을 구축하고 구글 드라이브를 마운트합니다.

 

3장에서는 Datasets 라이브러리와 Transformers 라이브러리를 활용하여 토크나이저 및 모델 준비, KLUE 데이터셋 전처리, 학습 파라미터 선정 및 학습 진행과 성능 평가를 실습해봅니다.

 

4장에서는 사전학습 단계부터 직접 진행해야 하는 경우를 대비하여 Tokenizers 라이브러리에 대해 살펴봅니다. 그리고 정확도, f1 스코어, 정밀도, 재현율을 기준으로 모델을 평가하는 Evaluate 라이브러리에 대해 알아봅니다.

 

5장에서는 트랜스포머 모델, 인코더 기반 모델, 디코더 기반 모델, 인코더-디코더 기반 모델의 기본 구조를 살펴보고 문장 분류, 다중 선택, 토큰 분류, 질의 응답, 조건부 생성, 인과적 언어 모델(Causal LM) 태스크의 코드와 결과를 확인해봅니다.

 

6장에서는 모델 구조별 대표 태스크에 대해 미세조정(파인튜닝, fine-tuning)을 진행합니다. 확률적 특징의 이해를 돕는 수식과 꼭 필요한 메서드의 파라미터까지 함께 살펴볼 수 있습니다.

 

7장에서는 PEFT, 양자화, QLoRA 미세조정과 같이 모델의 메모리 사용량은 줄이고 추론 속도는 높이는 경량화 기법에 대해 알아봅니다.

 

8장에서는 RLHF, SFT, PPO, DPO, KTO, CPO, ORPO, Best-of-N 샘플링, 보상 모델 트레이닝 등 정렬 조정에 해당하는 최신 방법론과 이를 강화학습을 위한 트랜스포머(TRL)를 통해 활용하는 방식에 대해 알아봅니다.

 

 

이 책이 필요한 독자

- 자연어 처리 분야에서의 인공지능에 대해 알고 싶은 분

- 언어 모델을 처음 접하는 대학생 또는 대학원생

- 허깅페이스 코드를 실습해보고 싶은 자연어 처리 초보자

- 언어 모델의 구조와 다양한 태스크를 샅샅이 살펴보고 싶은 분

- 허깅페이스에 대한 이해도는 있지만, 직접 부딪혀가며 코드로 기술을 레벨업하고 싶은 분

- 경량화 기법과 강화학습을 위한 트랜스포머에 대해 궁금한 분

저자 소개
저자 : 박성환, 남승우
도서리뷰 (0)
이 책을 읽고 어떤 느낌을 받으셨나요? 리뷰를 남기고 다른 독자들과 함께 공유해보세요.

등록된 리뷰가 없습니다

첫번째 리뷰어가 되어주세요

교환/반품/환불
반품/교환방법
  • 마이페이지 > 주문관리 > 주문/배송조회 > 주문조회 후  [1:1상담신청]  또는 고객센터 (1544-9020)
  • ※ 오픈마켓, 해외배송 주문상품 문의 시 [1:1상담신청] 또는 고객센터 (1544-9020)
반품/교환 가능기간
  • 변심반품의 경우 수령 후 7일 이내
  • 상품의 결함 및 계약내용과 다를 경우 문제점 발견 후 30일 이내
반품/교환비용
  • 단순변심 혹은 구매착오로 인한 반품/교환은 반송료 고객 부담
  • 해외직배송 도서 구매 후 단순변심에 의한 취소 및 반품 시 도서판매가의 20% 수수료 부과
반품/교환 불가 사유
  • 소비자의 책임 있는 사유로 상품 등이 손실 또는 훼손된 경우
  • 소비자의 사용, 포장 개봉에 의해 상품 등의 가치가 현저히 감소한 경우
    예) 만화, 잡지, 수험서 및 문제집류
  • 복제가 가능한 상품 등의 포장을 훼손한 경우
    예) 음반/DVD/비디오, 소프트웨어, 만화책, 잡지, 영상 화보집
  • 소비자의 요청에 따라 개별적으로 주문 제작되는 상품의 경우
  • 디지털 컨텐츠인 eBook, 오디오북 등을 1회 이상 다운로드를 받았을 경우
  • 시간의 경과에 의해 재판매가 곤란한 정도로 가치가 현저히 감소한 경우
  • 전자상거래 등에서의 소비자보호에 관한 법률이 정하는 소비자 청약철회 제한 내용에 해당되는 경우
상품 품절
  • 공급사(출판사) 재고 사정에 의해 품절/지연될 수 있으며, 품절 시 관련 사항에 대해서는 이메일과 문자로 안내드리겠습니다.
소비자 피해보상
환불지연에 따른 배상
  • 상품의 불량에 의한 교환, A/S, 환불, 품질보증 및 피해보상 등에 관한 사항은 소비자분쟁 해결 기준 (공정거래위원회 고시)에 준하여 처리됨
  • 대금 환불 및 환불지연에 따른 배상금 지급 조건, 절차 등은 전자상거래 등에서의 소비자 보호에 관한 법률에 따라 처리함

매장에서 사용할 수 있는 바코드가 있어요!