이 글에서는 VLA 모델의 성능을 개선시키는 데이터 수집 방법이 몇가지 있어 공유하고자 포스팅을 작성했다.프로젝트 개요목적: VLA 성능 향상을 위한 데이터 수집 방법환경: π0 모델 + 6축 로봇 SO-101 Arm태스크: 흩어진 색깔 블록을 집어 같은 색 박스에 넣기. 블록이 다 치워질 때까지 반복데이터: 텔레오퍼레이션으로 모은 60개 에피소드. 성공뿐 아니라 실패를 인지하고 보정하는 행동까지 포함결과: 성공 중심 데이터 수집 방법 대비 성공률 84.7% → 88.8%, 약 4%p 향상성격: 연구실 수준의 검증 case study왜 VLA를, 왜 이 태스크에 썼는가출발점은 기존 로봇 학습의 한계였다. 강화학습이나 모방학습으로 만든 정책은 정해진 한 작업, 정해진 환경에서는 잘 돌아간다. 그런데 환경이..
설비 여덟 대가 묶인 조립 공정에서, 한 설비가 고장 나면 그 줄 전체가 멈춰 병목이 생기는 문제가 있었다. 이걸 풀려고 설비 상태를 실시간으로 모니터링하고, 고장이 나면 작업을 다른 설비로 우회시키는 통합 관제 시스템을 만들었다. 이 글은 그 과정을 정리한 것이다.프로젝트 개요연구실의 레고 조립 공정은 자동화 설비 여덟 대로 구성돼 있다. 설비들이 순서대로 작업을 넘기는 구조라, 중간의 한 대가 멈추면 뒤 공정이 줄줄이 대기에 들어간다.프로젝트: 조립 공정 통합 관제 시스템 Coordinator 개발목표: 설비 상태를 실시간 모니터링하고, 고장 설비의 작업을 다른 설비로 동적 재분배해 병목 해소사용 기술: OPC UA 기반 상태 수집, MQTT 기반 명령 전달, Rule 기반 작업 재분배, MySQL구..
프로젝트 개요AST 셀은 이송되어 들어온 제품의 조립 불량 여부를 비전으로 판별하고, 양품만 선반에 적재하는 공정이다. AST 셀에서 나는 조립 불량 여부를 판단하는 AI 알고리즘 설계와 로봇이 이를 기반으로 산업용 로봇이 적재 작업을 수행할 수 있도록 waypoint 티칭을 담당했다.프로젝트: 외관 검사 기반 적재 공정 자동화목표: 들어오는 제품을 자동으로 조립 불량/양품 분류 → 양품만 공간 효율적으로 적재사용 기술: OpenCV(고정 위치 촬영 + 크롭 + 픽셀 기반 검사), HOG 특징 + SVM 분류, 1D 라이다 기반 재고 판단하드웨어: 현대로보틱스 산업용 로봇 + 듀얼 그리퍼, 라즈베리파이 카메라, 1D 라이다 센서, 공압 실린더, 근접 센서대상: 조립 제품(파트 + 케이스)성격: 연구실 데..
프로젝트 개요인수인계 받은 조립 자동화 셀은 제우스(Zeus) 로봇이 흩어진 2x4 파트를 집어 파트를 컨베이어 벨트 위에 내려놓으면 그 리니어 액추에이터가 그 파트를 집어 팔레트에 조립하는 공정이다. 조립 자동화 셀에서 흩어진 파트를 비전으로 인식해 산업용 로봇이 집도록 하는 역할을 담당했다. 프로젝트: 비정형 적재 환경에서의 3D Pick & Place 시스템 개선목표: 데모 데이 하루에 레고 2x4 블록 100개를 끊김 없이 조립사용 기술: SAM-6D(zero-shot 6DoF 자세 추정), Eye-to-Hand 캘리브레이션, 깊이 기반 폐루프 재시도하드웨어: 제우스 로봇 + 2-finger(parallel-jaw) 그리퍼, RGB-D 카메라(Kinect, 설비 고정형)대상: 흩어진 레고 2x4..
본 정리는 포항공과대학교 Physical AI 수업을 듣고 정리한 리뷰입니다. 틀린 내용이 있으면 댓글로 편안하게 말씀 부탁드립니다.Part5에서는 VLA(Vision Language Action Models)에 대해서 정리해보고자 합니다. 자세한 수식보다는 사람들이 직관적으로 이해할 수 있고 VLA가 이 흐름대로 발전했구나 정도의 Overview 느낌으로 정리해봤습니다.0. 로봇 제어가 왜 어려운가사람은 "컵을 집어"라는 말을 들으면 자동으로 한다. 하지만 로봇 입장에서 이건 여러 단계의 어려운 문제다.인식: 카메라 픽셀 더미에서 "어느 게 컵인지" 알아야 한다.언어 이해: "집어"가 무슨 동작인지, "컵"이 어느 물체를 가리키는지 알아야 한다.제어: 팔의 각 관절을 몇 도씩 움직여야 손끝이 컵에 닿는..
본 정리는 포항공과대학교 Physical AI 수업을 듣고 정리한 리뷰입니다. 틀린 내용이 있으면 댓글로 편안하게 말씀 부탁드립니다.Part4에서는 VLM(Vision-Language Models)에 대해서 정리해보고자 합니다. Visual Groundingvisual grounding은 언어를 이미지 안의 특정 region에 연결하는 작업이다. 이미지 전체에 라벨 하나를 붙이는 분류와 다르게, 문장이 가리키는 대상이 이미지의 어느 위치인지 찾아낸다.자연 이미지: "lady right" 같은 표현으로 여러 사람 중 특정 인물을 박스로 지정위성 이미지: "야구장 남동쪽 약 295m의 육상 트랙" 같은 관계 표현으로 영역 지정표현이 길고 관계적이어도 텍스트를 이미지의 한 지점에 묶는다는 점은 같다. 언어를 ..