김형 BLOG
10분 읽기

양자화 모델 실행과 LoRA 파인 튜닝

양자화된 모델 불러오기 양자화된 모델 불러오는 과정은 생각보다 간단하다. 다 AutoGPTQ가 해주기 때문이다..

파인튜닝양자화
10분 읽기

AutoGPTQ를 이용한 양자화 하는 방법

양자화는 성능의 정확도 손실에 미치지 않는 범위에서 float32에서 4bit,8bit와 같이 저밀도가 낮은 데이터 타입으로 표현해서 효율적 계산을 수행하도록 하는 방법 주로, 입력을 정량화 상수로 스케일링 하여 입력을 정규화 하는 것으로, 학습...

양자화
10분 읽기

LLM 기반의 서비스 만들 때

LLM 기반의 서비스 만들 때 LLM을 이용한 서비스를 많을때 필요한 과정을 선택할 때, 다음과 같은 요소들을 고려해야 합니다: 복잡성, 비용, 품질 등.

서빙
7분 읽기

VLLM 소개

PagedAttention은 vLLM(very Large Language Model)에서 사용되는 기술로, LLM(언어 모델)의 성능을 향상시키기 위한 것입니다. 이 기술의 주요 내용을 간단하게 설명하면 다음과 같습니다

서빙
7분 읽기

llama2를 context 8k까지 확장하는 방법 RoPE, exllama

해당 부분의 max_seq_len을 늘려주고 compress_pos_emb 혹은 alpha_value를 지정해준 것입니다. 여기서 원래 지원하는 max 시퀀스의 길이를 늘리고 싶은 만큼의 배수를 넣어주면 적용하면 됩니다.  이것이 어떻게 되는 것...

서빙파인튜닝
4분 읽기

nllb200을 이용한 다국어 번역

페이스북에서는 다국어 번역기 모델 nllb를 공개한 적이 있는데 다양한 파라미터와 증류된 모델까지 공개해놨다. 

모델리뷰
3분 읽기

Transformers를 generator로 만드는 방법

transformers를 쓰면 주로 model.generate()를 쓰게 되는데 이것을 쓰면 모든 토큰이 생성이 끝날때 까지 아무 것도 확인 할 수 없다. streamer 기능을 사용하면 바로바로 생성되는 토큰을 확인 할 수 있고 generato...

서빙
7분 읽기

SSE(서버-센트 이벤트)를 이용한 Flask 스트리밍 실시간 챗봇을 위한 연습

연습용 자료 첫번째는 오늘 하던 것 간단히 구현해서 업무에 적용시킬 프로젝트에 넣기위해 테스트 겸 만든 코드 SSE(서버-센트트 이벤트)는 클라이언트와 서버 간의 실시간 통신을 위한 웹 기술 중 하나다.

서빙