SAM: Segment Anything
·
ML&DL/논문리뷰
Abstract저자들은 Segment Anything 프로젝트를 통해 promptable segmentation task, 이를 수행하는 모델인 SAM, 11M 이미지와 1B개 이상의 마스크로 구성된 SA-1B를 함께 제안한다. SAM은 다양한 prompt에 따라 적절한 마스크를 예측할 수 있도록 설계되었으며, 새로운 데이터와 작업에도 zero-shot transfer가 가능하다. 실험 결과 SAM은 여러 과제에서 강한 일반화 성능을 보였고, 저자들은 이를 바탕으로 모델과 데이터셋을 공개하여 segmentation foundation model 연구를 확장하고자 하였다. Introduction최근 NLP에서는 대규모 데이터로 학습된 모델이 prompt를 통해 다양한 작업을 수행하는 방식이 널리 사용되고 ..
ViT: Transformers For Image Recognition At Scale
·
ML&DL/논문리뷰
ABSTRACT이 논문은 이미지 인식 분야의 기존 중심 구조인 CNN 대신, 이미지를 작은 패치로 나누고 이를 토큰처럼 처리하는 Transformer 기반 모델인 Vision Transformer(ViT)를 제안한다. ViT는 대규모 데이터로 사전 학습한 뒤 전이 학습을 적용하면, ImageNet, CIFAR-100, VTAB 등 다양한 벤치마크에서 기존 최첨단 CNN 모델과 비슷하거나 오히려 더 좋은 성능을 보이면서도 상대적으로 적은 계산 자원으로 학습할 수 있음을 보여준다. 1 INTRODUCTIONTransformer는 이미 자연어 처리 분야에서 압도적인 성과를 거두며 표준 모델로 자리 잡았지만, 컴퓨터 비전 분야에서는 여전히 CNN이 주로 사용되었다. 기존 연구들 역시 CNN 구조를 유지한 채 a..
Transformer: Attention Is All You Need
·
ML&DL/논문리뷰
Abstract기존의 시퀀스 변환 모델들은 주로 RNN이나 CNN 같은 구조에 의존해 왔습니다. 이런 모델들은 문장을 앞에서부터 순서대로 처리해야 했기 때문에, 계산이 느리고 한 번에 많은 단어를 동시에 처리하기가 어려웠습니다. 이에 비해 Transformer는 기존 방식과 달리, 어텐션만으로 문장을 처리하는 새로운 구조를 제안합니다. 이 구조에서는 문장 속 모든 단어가 서로를 한 번에 참고할 수 있어, 계산을 동시에 수행할 수 있고 그만큼 학습 속도와 효율이 크게 향상됩니다. 실제 실험 결과를 보면, Transformer는 WMT 2014 영어–독일어 번역에서 BLEU 28.4, 영어–프랑스어 번역에서 BLEU 41.8이라는 높은 성능을 기록하며, 기존 최고 성능 모델들을 넘어섰습니다. 특히 영어–프랑..
Mask R-CNN
·
ML&DL/논문리뷰
Abstract.Mask R-CNN은 Faster R-CNN에 마스크 예측 브랜치를 병렬로 추가해, 객체 검출과 인스턴스 마스크 생성을 동시에 수행하는 프레임워크다. 학습은 간단하고, Faster R-CNN 대비 오버헤드가 크지 않다. 또한 동일 프레임워크로 포즈 추정까지 일반화 가능하다고 말한다. 또한 COCO 챌린지의 instance segmentation / bbox detection / person keypoint detection 3가지 트랙에서 모두 최고 결과를 보여준다. Introduction. 인스턴스 세그멘테이션은 객체 탐지와 인스턴스 분할을 동시에 요구하므로 어렵지만, 의외로 단순한 확장으로 SOTA를 능가할 수 있다는 점에서 출발한다. 핵심 아이디어는 Faster R-CNN의 2-st..
U-Net: Convolutional Networks for Biomedical Image Segmentation
·
ML&DL/논문리뷰
Abstract.본 논문은 딥러닝은 보통 많은 양의 정답 데이터가 필요하다는 통념에서 시작해, 적은 수의 라벨 이미지로도 의료 영상 분할을 잘 학습시키기 위한 네트워크 구조와 학습 전략을 제시합니다. 핵심은 데이터 증강으로 제한된 라벨 데이터를 효율적으로 쓰는 것이고, 구조적으로는 문맥을 넓게 잡는 contracting path와 픽셀 단위 위치를 정밀하게 복원하는 대칭 expanding path를 결합해 분류와 localization을 동시에 해결한다는 점입니다. Introduction.본 논문은 최근 2년간 CNN이 시각 인식 테스크에서 SOTA를 달성한 건 ImageNet과 같은 대규모 데이터와 큰 모델을 감당할 수 있었기 때문이라 말합니다. 그러나 의료 영상의 경우, 이미지 1장에 대한 분류가 아..
Faster R-CNN: Towards Real-Time ObjectDetection with Region Proposal Networks
·
ML&DL/논문리뷰
Abstract당시 객체 탐지의 성능이 region proposal 단계에 크게 의존하면서, Fast R-CNN/SPPnet처럼 탐지 네트워크의 실행 시간을 줄일려는 시도가 있었다. 그럼에도 proposal 생성이 전체 속도의 병목이었다. 이를 해결하기 위해 본 논문은 Region Proposal Network(RPN)를 제안한다. 이는 검출 네트워크와 전체 이미지의 convolution feature를 공유해 proposal을 거의 추가 비용 없이 생성하는 것이다. RPN은 fully-convolutional 구조로 각 위치에서 물체일 확률(objectness)과 경계상자(bbox)를 동시에 예측하며, end-to-end로 학습되어 고품질 proposal을 만든다. 이렇게 생성된 proposal을 Fa..
VAE: Auto-Encoding Variational Bayes
·
ML&DL/논문리뷰
1. Introduction해당 논문은 연속 잠재 변수 또는 파라미터가 있는 생성모델에서 사후 분포가 intractable(다루기 어려울 때), 큰 데이터에서도 효율적으로 근사 추론+학습을 어떻게 하냐?는 물음에서 시작한다. 추론(inference)은 입력값 x로 z를 추정하는 과정으로, p(z)로 p_θ(x|z)인 x를 만든다. 학습을 위해서는 z를 알아내야하는데, 이를 사후분포라 한다.논문의 2.1 에서도 언급하지만, 사후분포는 p_θ(z|x)로 나타낼 수 있으며, 이는 베이즈 정리로 p_θ(z|x) = p_θ(x|z)p(z)/ p_θ(x)로 나타낼 수 있다. 이를 구하기 위해선, 분모의 p_θ(x) 값이 필요한데, p_θ(x) = ∫p_θ(x|z)p(z)dz라 적분을 사용해야해 매우 비싼 연산이다...
StyleGAN: A Style-Based Generator Architecture for Generative Adversarial Networks
·
ML&DL/논문리뷰
StyleGAN 논문은 PGGAN 구조에 Style transfer 개념을 적용하여 재구성한 논문이다. 그리해 StyleGAN을 정리하기 앞서 PGGAN을 간단하게나마 정리해보았다. [PGGAN] PGGAN는 낮은 해상도부터 높은 해상도까지 점진적으로 생성하는 생성모델로, z(노이즈 벡터, latent vector)를 정규화 후에 바로 Generator에 입력해 이미지 생성한다. 즉 z가 가진 모든 차원이 이미지의 모든 요소를 동시에 책임진다.z의 1번 값이 머리카락에만 영향을 주고z의 2번 값이 안경 여부에만 영향을 주고…이런 식의 역할 분담이 없다. 이러한 역할 분담이 없는 것을 latent space가 뒤엉켜 특징 구분이 어려운 상태로, entangled라고 한다. PGGAN의 Generator는 ..
CycleGAN: Unpaired Image-to-Image Translationusing Cycle-Consistent Adversarial Networks
·
ML&DL/논문리뷰
AbstractCycleGAN은 매칭된 이미지 쌍 없이(unpaired) 두 도메인 간의 이미지 변환을 학습하는 새로운 방식의 모델이다. 기존의 이미지 변환 기법들은 대부분 입력–정답 이미지가 1:1로 묶인 paired data가 필요했지만, CycleGAN은 X→Y로의 변환 G과 Y→X의 역변환 F을 함께 학습하고, cycle-consistency loss로 두 변환이 서로 모순되지 않도록 제약을 준다. Adversarial loss로 변환된 이미지가 목표 도메인 분포를 따르도록 만들고, cycle consistency는 개별 입력–출력(F(G(X)) ≈ X)간의 일관성을 유지하도록 강제한다. 이를 통해 페어링이 없는 데이터셋에서도 스타일 변환, 사물 변환, 계절 변환 등 다양한 이미지 변환을 수행하며..
R-CNN: Regions with CNNfeatures
·
ML&DL/논문리뷰
AbstractR-CNN은 기존 객체 검출 성능이 수년간 정체되어 있던 문제를 해결하기 위해, 복잡한 특징 조합이나 다양한 부가 정보 없이도 높은 성능을 달성하는 단순하고 확장 가능한 객체 검출 알고리즘을 제안한다. 이 방법은 약 2000개의 region proposal을 생성하고, 각 영역에 고용량 CNN을 적용하여 특징을 추출한 뒤, 클래스별 SVM으로 분류하는 구조를 사용한다. 또한 라벨이 적은 detection 데이터셋의 한계를 극복하기 위해 대규모 ImageNet 데이터셋에서 CNN을 지도 학습으로 사전학습한 후, detection용으로 미세조정(fine-tuning)하는 전략을 도입해 성능을 크게 향상시킨다. 이러한 접근을 통해 VOC 2012에서 기존 최고 성능 대비 mAP를 30% 이상 개..