본문 바로가기

전체 글

(13)
트랜스포머 공부 중... "트랜스포머를 활용한 자연어 처리" 책을 보며 평소에 관심 있었던 트랜스포머와 huggingface 라이브러리를 사용하는방법을 열심히 공부 중입니다. 공부가 안끝났는데 글을 왜 안쓰냐 책을 따라서 코드를 쥬피터로 사용하다가 메인보드가 고장나 버렸습니다...ㅠㅠ 전원부 쇼트시켜보니 메인보드 전원이 아예 안들어옴 파워는 잘 돌아감  오늘의 교훈코드 책은 무조건 무조건 무조건 코랩에서 진행해라   https://github.com/KwanWooPark97/transformer_study GitHub - KwanWooPark97/transformer_studyContribute to KwanWooPark97/transformer_study development by creating an account on Gi..
요격 시스템 파이썬 https://school.programmers.co.kr/learn/courses/30/lessons/181188 프로그래머스코드 중심의 개발자 채용. 스택 기반의 포지션 매칭. 프로그래머스의 개발자 맞춤형 프로필을 등록하고, 나와 기술 궁합이 잘 맞는 기업들을 매칭 받으세요.programmers.co.kr def solution(targets): targets.sort(key = lambda x: x[1]) shoot = -1 cnt = 0 for target in targets: if target[0] > shoot : cnt += 1 shoot = target[1]-0.1 return cnt 문제가 굉장히 충격적으로 다..
연속된 부분 수열의 합 파이썬 https://school.programmers.co.kr/learn/courses/30/lessons/178870 프로그래머스코드 중심의 개발자 채용. 스택 기반의 포지션 매칭. 프로그래머스의 개발자 맞춤형 프로필을 등록하고, 나와 기술 궁합이 잘 맞는 기업들을 매칭 받으세요.programmers.co.kr def solution(sequence, k): start = 0 end = 0 answer = [] now = sequence[0] while start k: now -= sequence[start] start += 1 elif now == k: answer.append([start, end]) ..
프로그래머스 석유 시추 파이썬 https://school.programmers.co.kr/learn/courses/30/lessons/250136 프로그래머스코드 중심의 개발자 채용. 스택 기반의 포지션 매칭. 프로그래머스의 개발자 맞춤형 프로필을 등록하고, 나와 기술 궁합이 잘 맞는 기업들을 매칭 받으세요.programmers.co.kr from collections import deque,defaultdictdef solution(land): answer = 0 num={} def bfs(y,x,gul): count=1 re=[[y,x]] q=deque() q.append([y,x]) visited[y][x]=gul dx=[0,0,-1,1]..
코딩 테스트 코드 리뷰 졸업하고 취업을 위해 코딩 테스트 준비를 계속 하고 있다 2월부터 지금까지 백준과 프로그래머스에서 약 1000문제 가까이 풀었는데 지금이라도 코드 리뷰 하려고 한다.
Determinitic Deep PG(DDPG) 공부하기 저번에는 A2C에 대해 공부했으니 이를 이용해서 나온 알고리즘인 DDPG를 공부한다. DDPG는 이름에서 알 수 있게 policy를 determinitic 하게 고르는 방식의 알고리즘이다. 논문을 처음 봤을 때는 많은 수식 때문에 이해하기 어려웠는데 수업시간에서 배운 내용으로 정리해보려고 한다. 내 생각에는 DDPG 알고리즘 자체는 PPO나 SAC 알고리즘에 밀려서 SOTA 알고리즘은 아니지만 잠깐 Pick-and-Place 작업을 공부했을 때 Reinforcement Learning for Pick and Place Operations in Robotics: A Survey이라는 논문을 읽었는데 많은 사람들이 다른 알고리즘보다 DDPG 알고리즘을 더 많이 사용하고 있다는 것을 알았다. 아직 직접 사용해..
Advantage Actor Critic (A2C) 정리 off-policy의 대표인 DQN을 저번에 다뤘으니 이번엔 on-policy의 시작인 A2C를 공부한다. 내가 공부한 알고리즘들은 대부분 A2C처럼 actor와 critic으로 나눠서 학습시키는 것이 대부분이었다. 그만큼 이 논문이 강화 학습에 큰 영향을 끼쳤다고 생각한다. 먼저 objective 함수를 바꿔본다. 궤적을 0:t와 t+1:T 까지로 나눠서 식을 새로 만든다. 이렇게 보면 t+1:T까지에 대한 식은 Q 함수의 정의와 같아진다. Q 함수를 사용하여 목적 함수를 다시 정의하면 위 사진과 같다. 처음봤을 때는 식이 굉장히 어려워 보였는데 이제는 기댓값의 정의와 Q함수의 정의만 이용해서 식을 전개했다는 것을 이해할 수 있다. 위 식의 장점은 더이상 에피소드가 끝날 때까지 기다리지 않아도 된다는 ..
Deep Q-Network(DQN) 공부하기 이번에는 강화학습의 시작을 알리는 DQN을 공부해보자. 처음 DQN은 알파고에 사용한 알고리즘으로 알파고가 엄청나게 유명해지면서 사용된 기술이 무엇인지 알아보고자 하는 사람들이 많아진 것이 강화학습에 사람들이 관심을 가지기 시작한게 아닌가 추측해본다. DQN부터는 V 함수와 Q 함수를 대부분 딥러닝 방법을 사용하여 estimate 하는 방향으로 강화학습이 연구된다. 심층 강화학습의 시작을 알리는 알고리즘인 만큼 강화학습 공부를 시작한다 하면 모든 책이나 강의들은 기본적인 이론을 다루고나서 DQN으로 본격적인 강화학습에대해서 시작한다. 앞에서 배웠던 Q 함수를 이제는 뉴럴 네트워크를 사용하여 표현한다. 앞으로 네트워크를 통해 estimate한 Q함수에는 $\theta$가 붙게된다. 뉴럴 네트워크를 사용한다..