Physical AI
close
프로필 배경
프로필 로고

Physical AI

  • 분류 전체보기 (21)
    • 스마트팩토리 프로젝트 (6)
    • VLA(Vision Langage Action) (6)
    • Reinforcement Learning (3)
    • 스마트팩토리 데이터 수집 공부 (1)
    • 어학 및 자격증 공부 (5)
  • 홈
  • 태그
  • 방명록
강화학습 Part 3 Planning by Dynamic Programming

강화학습 Part 3 Planning by Dynamic Programming

본 정리는 팡요랩(Pang-Yo Lab) 의 강화학습 강의(David Silver의 Reinforcement Learning Lecture 3: Planning by Dynamic Programming) 1. Introduction — DP가 뭐고 왜 MDP에 쓰나Dynamic Programming이라는 말Dynamic Programming(DP, 동적 계획법)은 복잡한 문제를 여러 개의 작은 부분 문제로 나누고, 각 부분 문제의 해를 이용해 전체 문제의 최적해를 구하는 방법이다.DP가 하는 일은 결국 세 단계다.복잡한 문제를 작은 부분 문제(subproblem)로 쪼갠다부분 문제를 푼다그 답들을 합쳐 전체 문제를 푼다DP를 쓸 수 있는 두 가지 조건DP는 아무 문제에나 통하지 않는다. 다음 두 성질이 ..

  • format_list_bulleted Reinforcement Learning
  • · 2026. 6. 25.
  • textsms
강화학습 Part 2  Markov Decision Processes

강화학습 Part 2 Markov Decision Processes

본 정리는 팡요랩(Pang-Yo Lab) 의 강화학습 강의(David Silver의 Reinforcement Learning Lecture 2: Markov Decision Processes)를 듣고 정리한 리뷰이다. Part 1에서 잡은 큰 그림을 바탕으로, 이번에는 강화학습 환경을 수학적으로 기술하는 틀인 MDP를 다룬다.전체 그림을 먼저 깔면 이렇다. 가장 단순한 마르코프 프로세스(MP)에 보상과 할인을 붙이면 마르코프 리워드 프로세스(MRP)가 되고, 거기에 행동(선택)을 붙이면 마르코프 결정 프로세스(MDP)가 된다. 즉 한 줄로 줄이면 MRP = MP + 보상, MDP = MRP + 행동이다.1. 마르코프 성질 (Markov Property)한 문장으로는 "미래는 현재가 주어지면 과거와 독립이..

  • format_list_bulleted Reinforcement Learning
  • · 2026. 6. 24.
  • textsms
강화학습 Part 1 — Overview of Reinforcement Learning

강화학습 Part 1 — Overview of Reinforcement Learning

본 정리는 팡요랩(Pang-Yo Lab) 의 강화학습 강의(David Silver의 Introduction to Reinforcement Learning 1강)를 듣고 직접 정리한 리뷰이다. 1. 강화학습이란 무엇인가강화학습(Reinforcement Learning)은 한마디로 누적 보상(cumulative reward)을 최대화하는 행동 방식(policy)을 스스로 찾아가는 학습이다. 지도학습처럼 "정답"을 알려주는 대신, 행동의 결과로 받은 보상만 가지고 더 나은 행동을 찾아 나간다.머신러닝을 보통 지도학습 · 비지도학습 · 강화학습으로 나누는데, 강화학습은 다른 두 분야와 결이 꽤 다르다. 그 차이를 만드는 특징이 아래 네 가지이다.강화학습을 다른 학습과 구분 짓는 특징① Supervisor가 없다..

  • format_list_bulleted Reinforcement Learning
  • · 2026. 6. 23.
  • textsms
  • navigate_before
  • 1
  • navigate_next
전체 카테고리
  • 분류 전체보기 (21)
    • 스마트팩토리 프로젝트 (6)
    • VLA(Vision Langage Action) (6)
    • Reinforcement Learning (3)
    • 스마트팩토리 데이터 수집 공부 (1)
    • 어학 및 자격증 공부 (5)
최근 글
인기 글
최근 댓글
Copyright © 쭈미로운 생활 All rights reserved.
Designed by JJuum

티스토리툴바