Computer Vision

์ด๋ฏธ์ง€ยท์˜์ƒ ์ธ์‹ ๋ชจ๋ธ๊ณผ ์ปดํ“จํ„ฐ ๋น„์ „ ์—ฐ๊ตฌ.

์ด๋ฏธ์ง€ยท์˜์ƒ ์ธ์‹ ๋ชจ๋ธ๊ณผ ์ปดํ“จํ„ฐ ๋น„์ „ ์—ฐ๊ตฌ.

์ƒ์œ„ ๊ฐœ๋…: ๋”ฅ๋Ÿฌ๋‹

21 posts · ์•„์นด์ด๋ธŒ์—์„œ ํ•„ํ„ฐ๋กœ ๋ณด๊ธฐ

[Paper Review] LLaVA: Visual Instruction Tuning - ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ AI์˜ ์ƒˆ๋กœ์šด ํŒจ๋Ÿฌ๋‹ค์ž„

https://arxiv.org/pdf/2304.08485 ๋…ผ๋ฌธ ์ •๋ณด ์ œ๋ชฉ: Visual Instruction Tuning ์ €์ž: Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee ์†Œ์†: University of Wisconsinโ€“Madison, Microsoft Research, ...

[Paper Review] LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

https://arxiv.org/pdf/2403.15388 ๋…ผ๋ฌธ ์ •๋ณด ์ œ๋ชฉ: LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models ์ €์ž: Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan ...

[Paper Review] MM-Groundung-DINO : An Open and Comprehensive Pipeline for Unified Object Grounding and Detection

https://arxiv.org/pdf/2401.02361 ๋ณธ ๋ฆฌ๋ทฐ๋Š” ์›๋ฌธ์„ ์ตœ๋Œ€ํ•œ ์ง์—ญํ•œ ๋‚ด์šฉ์ž…๋‹ˆ๋‹ค. ์—ฌ๊ธฐ์„œ โ€œ์šฐ๋ฆฌ๋Š”โ€์€ ์ €์ž๋ฅผ ์ง€์นญํ•ฉ๋‹ˆ๋‹ค. ์ฐธ๊ณ  ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค. ์ดˆ๋ก Grounding-DINO๋Š” Open-Vocabulary Detection (OVD), Phrase Grounding (PG), Referring Expression C...

[Paper Review] LLM-Det : Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models

https://arxiv.org/pdf/2501.18954 ๋ณธ ๋ฆฌ๋ทฐ๋Š” ์›๋ฌธ์„ ์ตœ๋Œ€ํ•œ ์ง์—ญํ•œ ๋‚ด์šฉ์ž…๋‹ˆ๋‹ค. ์—ฌ๊ธฐ์„œ โ€œ์šฐ๋ฆฌ๋Š”โ€์€ ์ €์ž๋ฅผ ์ง€์นญํ•ฉ๋‹ˆ๋‹ค. ์ฐธ๊ณ  ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค. Abstract ์ตœ๊ทผ open-vocabulary detector๋“ค์€ ํ’๋ถ€ํ•œ region-level ์ฃผ์„ ๋ฐ์ดํ„ฐ๋กœ ์œ ๋งํ•œ ์„ฑ๋Šฅ์„ ๋‹ฌ์„ฑํ•˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค. (์ฐธ๊ณ ) Regio...

[Paper Review] RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer

https://arxiv.org/pdf/2407.17140 ๋ณธ ๋ฆฌ๋ทฐ๋Š” ์›๋ฌธ์„ ์ตœ๋Œ€ํ•œ ์ง์—ญํ•œ ๋‚ด์šฉ์ž…๋‹ˆ๋‹ค. ์—ฌ๊ธฐ์„œ โ€œ์šฐ๋ฆฌ๋Š”โ€์€ ์ €์ž๋ฅผ ์ง€์นญํ•ฉ๋‹ˆ๋‹ค. ์ฐธ๊ณ  ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค. ์ดˆ๋ก ์ด ๋ณด๊ณ ์„œ์—์„œ๋Š” ๊ฐœ์„ ๋œ ์‹ค์‹œ๊ฐ„ Detection Transformer์ธ RT-DETRv2๋ฅผ ์ œ์‹œํ•ฉ๋‹ˆ๋‹ค. RT-DETRv2๋Š” ๊ธฐ์กด์˜ ์ตœ์‹  ์‹ค์‹œ๊ฐ„ detector์ธ RT-D...

[Paper Review] OmDet_Turbo : Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head

https://arxiv.org/pdf/2403.06892 ์ดˆ๋ก End-to-end transformer ๊ธฐ๋ฐ˜ detector (DETRs)๋Š” ์–ธ์–ด modality ํ†ตํ•ฉ์„ ํ†ตํ•ด closed-set๊ณผ open-vocabulary object detection (OVD) ์ž‘์—… ๋ชจ๋‘์—์„œ ๋›ฐ์–ด๋‚œ ์„ฑ๋Šฅ์„ ๋ณด์—ฌ์ฃผ์—ˆ์Šต๋‹ˆ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ๋†’์€ ์—ฐ์‚ฐ ์š”๊ตฌ์‚ฌํ•ญ์œผ๋กœ...

[Paper Review] EXAONE Path 2.0: Pathology Foundation Model with End-to-End Supervision

https://arxiv.org/abs/2507.06639 1 PYEON, Myeongjang, et al. EXAONE Path 2.0: Pathology Foundation Model with End-to-End Supervision. arXiv preprint arXiv:2507.06639, 2025. Abstract ๋””์ง€ํ„ธ ๋ณ‘...

[Paper Review] Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

https://arxiv.org/abs/2308.12966 1 WANG, Peng, et al. Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution. arXiv preprint arXiv:2409.12191, 2024. ์ดˆ๋ก ๋ณธ ์—ฐ๊ตฌ...

[Paper Review] Qwen-Image Technical Report

https://arxiv.org/abs/2508.02324 1 WU, Chenfei, et al. Qwen-image technical report. arXiv preprint arXiv:2508.02324, 2025. ๋ณธ ์—ฐ๊ตฌ์—์„œ๋Š” ๋ณต์žกํ•œ ํ…์ŠคํŠธ ๋ Œ๋”๋ง๊ณผ ์ •๋ฐ€ํ•œ ์ด๋ฏธ์ง€ ํŽธ์ง‘์—์„œ ์ƒ๋‹นํ•œ ์ง„๋ณด๋ฅผ ์ด๋ฃฌ Qwen ์‹œ๋ฆฌ์ฆˆ์˜ ์ด๋ฏธ์ง€ ์ƒ์„ฑ fou...

[Paper Review] An Efficient Statistical Method for Image Noise Level Estimation

๋งํฌ : https://www.cv-foundation.org/openaccess/content_iccv_2015/papers/Chen_An_Efficient_Statistical_ICCV_2015_paper.pdf (์ฐธ๊ณ ) ์ด ๋…ผ๋ฌธ์€ 2015๋…„์— ๋ฐœํ‘œ๋œ ๊ฒƒ์œผ๋กœ, ํ˜„์žฌ ๊ธฐ์ค€์—์„œ๋Š” ์ตœ์‹  ๊ธฐ์ˆ ์ด๋ผ๊ณ  ๋ณด๊ธฐ ์–ด๋ ต์Šต๋‹ˆ๋‹ค. ๋ณธ๋ฌธ์—์„œ ์–ธ๊ธ‰๋œ โ€œ์ตœ๊ทผโ€ ...

[Paper Review] A COMPREHENSIVE REVIEW OF YOLO ARCHITECTURES IN COMPUTER VISION: FROM YOLOV1 TO YOLOV8 AND YOLO-NAS

YOLO ๋ชจ๋ธ ์„œ๋ฒ ์ด ํŽ˜์ดํผ ๋งํฌ : https://www.mdpi.com/2504-4990/5/4/83 ๐Ÿ“– (์ฐธ๊ณ ) YOLO ๋ฒ„์ „์˜ ๋ฐœ์ „ ๐Ÿ’ก ๊ณต์‹ ๋ฒ„์ „: YOLO์˜ ์› ๊ฐœ๋ฐœ์ž์ธ Joseph Redmon์€ YOLOv3๊นŒ์ง€ ๊ฐœ๋ฐœํ–ˆ์Šต๋‹ˆ๋‹ค. ์ดํ›„ ๊ทธ๋Š” ์œค๋ฆฌ์  ์ด์œ ๋กœ ๊ฐ์ฒด ํƒ์ง€ ์—ฐ๊ตฌ๋ฅผ ์ค‘๋‹จํ–ˆ์Šต๋‹ˆ๋‹ค. Joseph Redmon์ด ๊ฐ์ฒด ํƒ...

[CV Notes] Lecture 18 - Videos

๋‹ค์Œ์€ ์•„๋ž˜ โ€œLecture 18. Videosโ€์— ๋Œ€ํ•œ ์š”์•ฝ ๋ฐ ํ•„๊ธฐ ๋‚ด์šฉ์„ ์ •๋ฆฌํ•œ ๊ฒƒ์ž…๋‹ˆ๋‹ค. ํ‹€๋ฆฐ ๋‚ด์šฉ์ด ์žˆ๋‹ค๋ฉด ๋Œ“๊ธ€ ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค ๐Ÿ™Œ Course Website: https://web.eecs.umich.edu/~justincj/teaching/eecs498/ Instructor: Justin Johnson Lecture 18: Vi...

[CV Notes] Lecture 17 - 3D Vision

๋‹ค์Œ์€ ์•„๋ž˜ Lecture์— ๋Œ€ํ•œ ์š”์•ฝ ๋ฐ ํ•„๊ธฐ ๋‚ด์šฉ์„ ์ •๋ฆฌํ•œ ๊ฒƒ์ž…๋‹ˆ๋‹ค. ํ‹€๋ฆฐ ๋‚ด์šฉ์ด ์žˆ๋‹ค๋ฉด ๋Œ“๊ธ€ ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค ๐Ÿ™Œ Course Website: https://web.eecs.umich.edu/~justincj/teaching/eecs498/ Instructor: Justin Johnson Lecture 17: 3D Vision 1...

[๊ฐœ๋…] ์ƒ์„ฑ AI์˜ ํ•™์Šต ๋ฐฉ์‹: ์ œ๋กœ์ƒทยท์›์ƒทยทํ“จ์ƒท ๋Ÿฌ๋‹

์ตœ๊ทผ ์ฑ—GPT๋กœ ์ธํ•ด ๋ถ€์ƒํ•œ ์ œ๋กœ์ƒท(zero-shot), ์›์ƒท(one-shot), ํ“จ์ƒท(few-shot) ๋Ÿฌ๋‹ ๊ธฐ๋ฒ•์€ ๋ฐ์ดํ„ฐ๋ฅผ ์ผ์ผ์ด ๋ผ๋ฒจ๋งํ•˜์ง€ ์•Š๊ณ ๋„ ๋จธ์‹ ๋Ÿฌ๋‹ ๋ชจ๋ธ์„ ํ•™์Šต์‹œํ‚ฌ ์ˆ˜ ์žˆ๋„๋ก ํ•ด์ค๋‹ˆ๋‹ค. ํ•ด๋‹น ํฌ์ŠคํŠธ๋Š” CV(Computer Vision) ๋ฐ NLP(Natural Language Processing)์˜ ๊ด€์ ์—์„œ N-shot learning์„ ...

[ํŒŒ์ดํ† ์น˜] ํŒŒ์ดํ† ์น˜๋กœ CNN ๋ชจ๋ธ์„ ๊ตฌํ˜„ํ•ด๋ณด์ž! (ResNetํŽธ)

์•ˆ๋…•ํ•˜์„ธ์š”! ์ง€๋‚œ๋ฒˆ ํฌ์ŠคํŠธ์ธ VGGNet๊ณผ GoogleNet ์ดํ›„๋กœ ์˜ค๋Š˜์€ ResNet ๊ด€๋ จ ํฌ์ŠคํŠธ์ž…๋‹ˆ๋‹ค. 2๋ฒˆ์— ๊ฑธ์นœ ํฌ์ŠคํŒ…์—์„œ ์†Œ๊ฐœ๋“œ๋ ธ๋‹ค์‹œํ”ผ ์ปดํ“จํ„ฐ ๋น„์ „ ๋Œ€ํšŒ ์ค‘์— ILSVRC (Imagenet Large Scale Visual Recognition Challenges)์ด๋ผ๋Š” ๋Œ€ํšŒ๊ฐ€ ์žˆ๋Š”๋ฐ, ๋ณธ ๋Œ€ํšŒ๋Š” ๊ฑฐ๋Œ€ ์ด๋ฏธ์ง€๋ฅผ 1000๊ฐœ์˜ ์„œ๋ธŒ์ด๋ฏธ์ง€๋กœ ๋ถ„๋ฅ˜...

[ํŒŒ์ดํ† ์น˜] ํŒŒ์ดํ† ์น˜๋กœ CNN ๋ชจ๋ธ์„ ๊ตฌํ˜„ํ•ด๋ณด์ž! (GoogleNetํŽธ)

์•ˆ๋…•ํ•˜์„ธ์š”! ์ง€๋‚œ๋ฒˆ ํฌ์ŠคํŠธ์ธ VGGNet ์ดํ›„๋กœ ์˜ค๋Š˜์€ GoogleNet ๊ด€๋ จ ํฌ์ŠคํŠธ์ž…๋‹ˆ๋‹ค. ๋‹ค์Œ ํฌ์ŠคํŠธ๋Š” ResNet์œผ๋กœ ์ฐพ์•„๋ต™๋„๋ก ํ•˜๊ฒ ์Šต๋‹ˆ๋‹ค. ์ง€๋‚œ๋ฒˆ์—๋„ ์†Œ๊ฐœ๋“œ๋ ธ๋‹ค์‹œํ”ผ ์ปดํ“จํ„ฐ ๋น„์ „ ๋Œ€ํšŒ ์ค‘์— ILSVRC (Imagenet Large Scale Visual Recognition Challenges)์ด๋ผ๋Š” ๋Œ€ํšŒ๊ฐ€ ์žˆ๋Š”๋ฐ, ๋ณธ ๋Œ€ํšŒ๋Š” ๊ฑฐ๋Œ€ ์ด๋ฏธ์ง€๋ฅผ 1...

[ํŒŒ์ดํ† ์น˜] ํŒŒ์ดํ† ์น˜๋กœ CNN ๋ชจ๋ธ์„ ๊ตฌํ˜„ํ•ด๋ณด์ž! (VGGNetํŽธ)

์•ˆ๋…•ํ•˜์„ธ์š”! ์˜ค๋Š˜ ํฌ์ŠคํŒ…๋ถ€ํ„ฐ ๋‹ค์Œ๋‹ค์Œ ํฌ์ŠคํŒ…๊นŒ์ง€๋Š” CNN ๋ชจ๋ธ์˜ ๋ผˆ๋Œ€๊ฐ€ ๋˜๋Š” ๋ชจ๋ธ๋“ค์ธ VGGNet, GoogleNet, ResNet์„ ์†Œ๊ฐœํ•˜๊ณ  ์ด๋ฅผ ๊ตฌํ˜„ํ•ด๋ณด๋Š” ์‹œ๊ฐ„์„ ๊ฐ–๋„๋ก ํ•˜๊ฒ ์Šต๋‹ˆ๋‹ค! :) ์ด๋ฒˆ ํฌ์ŠคํŒ…์€ VGGNet ๊ด€๋ จ ํฌ์ŠคํŠธ์ž…๋‹ˆ๋‹ค. ๋จผ์ € ILSVRC (Imagenet Large Scale Visual Recognition Challenges)์ด...

[ํŒŒ์ดํ† ์น˜] ํŒŒ์ดํ† ์น˜๋กœ CNN ๋ชจ๋ธ์„ ๊ตฌํ˜„ํ•ด๋ณด์ž! (๊ธฐ์ดˆํŽธ + DataLoader ์‚ฌ์šฉ๋ฒ•)

MNIST ๋ฐ์ดํ„ฐ - CNN ์‹ค์Šต ์˜ค๋Š˜์€ MNIST ๋ฐ์ดํ„ฐ๋กœ Convolutional Neural Network(์ดํ•˜ CNN)์„ ๊ตฌํ˜„ํ•˜๊ณ  ๋Œ๋ ค๋ณด๋Š” ์‹œ๊ฐ„์„ ๊ฐ–๋„๋ก ํ•˜๊ฒ ์Šต๋‹ˆ๋‹ค! ๋จผ์ €, CNN์€ ํฌ๊ฒŒ ์•„๋ž˜์™€ ๊ฐ™์€ ๊ตฌ์„ฑ์š”์†Œ๋กœ ์ด๋ฃจ์–ด์ ธ ์žˆ์Šต๋‹ˆ๋‹ค. ํ•ฉ์„ฑ๊ณฑ ์—ฐ์‚ฐ(Convolution) : ์ด๋ฏธ์ง€์˜ ํŠน์„ฑ์„ ์ถ”์ถœํ•˜๋Š” ๊ณ„์ธต ๋งฅ์Šคํ’€๋ง(Max Pooling)...

[Paper Review] An Image Is Worth 16x16 Words : Transformers for Image Recognition at Scale (Vision Transformer)

์„ ์ • ์ด์œ  ์•ˆ๋…•ํ•˜์„ธ์š”! ์˜ค๋Š˜ ๋…ผ๋ฌธ๋ฆฌ๋ทฐ, ์ฝ”๋“œ๋ฆฌ๋ทฐํ•ด๋ณผ ๋…ผ๋ฌธ์€ โ€œAn Image Is Worth 16x16 Words: Transformers for Image Recognition at Scaleโ€ ๋กœ, ์ปดํ“จํ„ฐ ๋น„์ „์—์„œ Transformer์™€ Attention์ด ์“ฐ์ด๊ฒŒ ๋œ ๊ฒฐ์ •์  ๊ณ„๊ธฐ(?)๊ฐ€ ๋œ ๋…ผ๋ฌธ์ž…๋‹ˆ๋‹ค. ์ตœ๊ทผ ์ด์ชฝ ๋ถ„์•ผ์— ๊ด€์‹ฌ์ด ๋งŽ๋‹ค ๋ณด๋‹ˆ ์˜ค๋Š˜์€ ...

[Paper Review] An Architecture Combining Convolutional Neural Network(CNN) and Support Vector Machine(SVM) for Image Classification

์˜ค๋Š˜ ๋ฆฌ๋ทฐ/๋ฒˆ์—ญ/๊ตฌํ˜„ํ•  ๋…ผ๋ฌธ์€ โ€œAbien Fred M. Agarapโ€ ์ €์ž๊ฐ€ ์“ด ๋…ผ๋ฌธ์œผ๋กœ, โ€œYichuan Tangโ€์˜ โ€œDeep Learning using Linear Support Vector Machinesโ€์„ ๋ณด๊ณ  inspired๋˜์–ด ์—ฐ๊ตฌํ•˜๊ฒŒ ๋˜์—ˆ๋‹ค๊ณ  ํ•œ๋‹ค. ํ•˜๋‹จ์˜ ์ฐธ๊ณ  ๋…ผ๋ฌธ ์†Œ์Šค์— ํ•ด๋‹น ๋…ผ๋ฌธ ๋งํฌ์™€ ์ด๋ฒˆ ๋…ผ๋ฌธ์˜ ๋งํฌ๋ฅผ ์ฒจ๋ถ€์˜€๋‹ค. (์ฐธ๊ณ ) ...

[Paper Review] Transferring Inductive Bias Through Knowledge Distillation - (3/3)

์•ˆ๋…•ํ•˜์„ธ์š” :) ์˜ค๋Š˜์€ ์ง€๋‚œ๋ฒˆ ํฌ์ŠคํŒ…์— ์ด์–ด์„œ โ€œTransferring Inductive Bias Through Knowledge Distillationโ€ ๋…ผ๋ฌธ์— ๋Œ€ํ•œ ์ •๋ฆฌ๋ฅผ ์ด์–ด๋‚˜๊ฐ€ ๋ณด๋„๋ก ํ•˜๊ฒ ์Šต๋‹ˆ๋‹ค. ์ด์ „ ํฌ์ŠคํŒ…์—์„œ ๋ณธ ๋…ผ๋ฌธ์—์„œ ๋‹ค๋ฃจ๊ฒŒ ๋  ์ฃผ์š” ๊ฐœ๋…๋“ค์ธ Knowledge Distillation๊ณผ Inductive Bias์— ๋Œ€ํ•œ ์„ค๋ช…๊ณผ RNNs v...