'Vision' 태그의 글 목록

본문 바로가기

Vision

PoseNet: TensorFlow.js으로 실시간 human pose estimation 구현하기 자바스크립트로 ML 모델을 개발하고 브라우저 혹은 Node.js에서 실행할 수 있는 TensorFlow.js을 활용하여 실시간으로 사람의 자세를 추정하는 human pose estimation을 구현할 수 있습니다. 참고 자료 : https://blog.tensorflow.org/2018/05/real-time-human-pose-estimation-in.html 구글 라이브 데모 >> https://storage.googleapis.com/tfjs-models/demos/posenet/camera.html PoseNet - PoseNet은 MobileNet 혹은 ResNet 기반의 human pose estimation 네트워크이다. - TensorFlow.js에서 실행할 수 있기 때문에 a) 웹캠 혹.. 더보기

[논문리뷰] Vision Transformer - An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale ** 작년에 공개된 구글 리서치 논문입니다 ** An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (A.K.A) Vision Transformer 개요 비전 AI도 CNN없이 풀 수 있다! Transformer만을 사용하여 이미지 분류 태스크 수행하기 - 이미지는 이미지 조각의 시퀀스로 처리함 - 대량의 데이터에 대해 사전 학습한 후 작은 이미지 인식 벤치마크(이미지넷, CIFAR-100, VTAB)에 적용 - 그 결과 Vision Transformer(ViT)은 여타의 SOTA CNN 기반의 모델과 비교했을 때 훌륭한 성능을 얻음. - 동시에 학습 과정에서의 계산 자원은 훨씬 적게 소모함 [ Transformer의 계산.. 더보기

이전 1 다음

티스토리툴바