Transformer

Self-Attention ๊ธฐ๋ฐ˜ Transformer ์•„ํ‚คํ…์ฒ˜์™€ ์ด๋ฅผ ๋น„์ „ยท์–ธ์–ด ๋“ฑ ๋‹ค์–‘ํ•œ ๋„๋ฉ”์ธ์— ์ ์šฉํ•œ ๋ชจ๋ธ์„ ๋‹ค๋ฃฌ ๊ธ€.

Transformer ๊ด€๋ จ ๊ธ€ ๋ชจ์Œ.

13 posts · ์•„์นด์ด๋ธŒ์—์„œ ํ•„ํ„ฐ๋กœ ๋ณด๊ธฐ

[Paper Review] LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

https://arxiv.org/pdf/2403.15388 ๋…ผ๋ฌธ ์ •๋ณด ์ œ๋ชฉ: LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models ์ €์ž: Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan ...

[Paper Review] MM-Groundung-DINO : An Open and Comprehensive Pipeline for Unified Object Grounding and Detection

https://arxiv.org/pdf/2401.02361 ๋ณธ ๋ฆฌ๋ทฐ๋Š” ์›๋ฌธ์„ ์ตœ๋Œ€ํ•œ ์ง์—ญํ•œ ๋‚ด์šฉ์ž…๋‹ˆ๋‹ค. ์—ฌ๊ธฐ์„œ โ€œ์šฐ๋ฆฌ๋Š”โ€์€ ์ €์ž๋ฅผ ์ง€์นญํ•ฉ๋‹ˆ๋‹ค. ์ฐธ๊ณ  ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค. ์ดˆ๋ก Grounding-DINO๋Š” Open-Vocabulary Detection (OVD), Phrase Grounding (PG), Referring Expression C...

[Paper Review] RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer

https://arxiv.org/pdf/2407.17140 ๋ณธ ๋ฆฌ๋ทฐ๋Š” ์›๋ฌธ์„ ์ตœ๋Œ€ํ•œ ์ง์—ญํ•œ ๋‚ด์šฉ์ž…๋‹ˆ๋‹ค. ์—ฌ๊ธฐ์„œ โ€œ์šฐ๋ฆฌ๋Š”โ€์€ ์ €์ž๋ฅผ ์ง€์นญํ•ฉ๋‹ˆ๋‹ค. ์ฐธ๊ณ  ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค. ์ดˆ๋ก ์ด ๋ณด๊ณ ์„œ์—์„œ๋Š” ๊ฐœ์„ ๋œ ์‹ค์‹œ๊ฐ„ Detection Transformer์ธ RT-DETRv2๋ฅผ ์ œ์‹œํ•ฉ๋‹ˆ๋‹ค. RT-DETRv2๋Š” ๊ธฐ์กด์˜ ์ตœ์‹  ์‹ค์‹œ๊ฐ„ detector์ธ RT-D...

[Paper Review] OmDet_Turbo : Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head

https://arxiv.org/pdf/2403.06892 ์ดˆ๋ก End-to-end transformer ๊ธฐ๋ฐ˜ detector (DETRs)๋Š” ์–ธ์–ด modality ํ†ตํ•ฉ์„ ํ†ตํ•ด closed-set๊ณผ open-vocabulary object detection (OVD) ์ž‘์—… ๋ชจ๋‘์—์„œ ๋›ฐ์–ด๋‚œ ์„ฑ๋Šฅ์„ ๋ณด์—ฌ์ฃผ์—ˆ์Šต๋‹ˆ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ๋†’์€ ์—ฐ์‚ฐ ์š”๊ตฌ์‚ฌํ•ญ์œผ๋กœ...

[Paper Review] Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

https://arxiv.org/abs/2308.12966 1 WANG, Peng, et al. Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution. arXiv preprint arXiv:2409.12191, 2024. ์ดˆ๋ก ๋ณธ ์—ฐ๊ตฌ...

[Paper Review] Qwen-Image Technical Report

https://arxiv.org/abs/2508.02324 1 WU, Chenfei, et al. Qwen-image technical report. arXiv preprint arXiv:2508.02324, 2025. ๋ณธ ์—ฐ๊ตฌ์—์„œ๋Š” ๋ณต์žกํ•œ ํ…์ŠคํŠธ ๋ Œ๋”๋ง๊ณผ ์ •๋ฐ€ํ•œ ์ด๋ฏธ์ง€ ํŽธ์ง‘์—์„œ ์ƒ๋‹นํ•œ ์ง„๋ณด๋ฅผ ์ด๋ฃฌ Qwen ์‹œ๋ฆฌ์ฆˆ์˜ ์ด๋ฏธ์ง€ ์ƒ์„ฑ fou...

[Paper Review] Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

https://arxiv.org/abs/2311.07919 1 CHU, Yunfei, et al. Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models. arXiv preprint arXiv:2311.07919, 202...

[Paper Review] Qwen Technical Report

https://arxiv.org/abs/2309.16609 1 BAI, Jinze, et al. Qwen technical report. arXiv preprint arXiv:2309.16609, 2023. ๐Ÿ’ก QWEN์€ ์ค‘๊ตญ์–ด๋กœ โ€œ์ฒœ ๊ฐœ์˜ ์งˆ๋ฌธโ€์„ ์˜๋ฏธํ•˜๋Š” Qianwen์˜ ๋ณ„๋ช…์ž…๋‹ˆ๋‹ค. โ€œQWENโ€์˜ ๋ฐœ์Œ์€ ๋งฅ๋ฝ๊ณผ ๋งํ•˜๋Š” ๊ฐœ์ธ์— ...

[TREND] ํŠธ๋ Œ์Šคํฌ๋จธ ์ดํ›„์˜ ์ฐจ์„ธ๋Œ€ ์•„ํ‚คํ…์ณ: MoE, SSM, RetNet, V-JEPA

2017๋…„, โ€œAttention is All You Needโ€๋ผ๋Š” ๋…ผ๋ฌธ๊ณผ ํ•จ๊ป˜ ๋“ฑ์žฅํ•œ ํŠธ๋žœ์Šคํฌ๋จธ(Transformer)๋Š” AI ๋ชจ๋ธ์˜ ํ˜์‹ ์ ์ธ ๋ณ€ํ™”๋ฅผ ์ด๋Œ์—ˆ์Šต๋‹ˆ๋‹ค. ํ˜„์žฌ, ๋Œ€ํ˜• ์–ธ์–ด ๋ชจ๋ธ(LLM)๊ณผ ์ƒ์„ฑ AI๋Š” ์–ธ์–ด, ๋น„๋””์˜ค, ์ด๋ฏธ์ง€ ๋“ฑ์˜ ๋ฐ์ดํ„ฐ ์ฒ˜๋ฆฌ์—์„œ ์••๋„์ ์ธ ์„ฑ๋Šฅ์„ ๋ฐœํœ˜ํ•˜๋ฉฐ ์šฐ๋ฆฌ ์‚ถ์˜ ๋‹ค์–‘ํ•œ ์˜์—ญ์—์„œ ํ™œ์šฉ๋˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ํŠธ๋žœ์Šคํฌ๋จธ ๊ธฐ...

[๊ฐœ๋…] GLU์™€ ๊ทธ ๋ณ€ํ˜•๋“ค: ์—ญ์‚ฌ์™€ ์ฃผ์š” ๊ฐœ๋… ์ •๋ฆฌ

๋”ฅ๋Ÿฌ๋‹ ๋ถ„์•ผ์—์„œ ํ™œ์„ฑํ™” ํ•จ์ˆ˜๋Š” ์‹ ๊ฒฝ๋ง ๋ชจ๋ธ์ด ํ•™์Šตํ•  ๋•Œ ์ค‘์š”ํ•œ ์—ญํ• ์„ ํ•ฉ๋‹ˆ๋‹ค. ์ด ์ค‘์—์„œ๋„ GLU(Gated Linear Unit)๋Š” ๊ณ ๊ธ‰ ๋ชจ๋ธ์—์„œ ์ž์ฃผ ์‚ฌ์šฉ๋˜๋Š” ํ™œ์„ฑํ™” ํ•จ์ˆ˜ ์ค‘ ํ•˜๋‚˜์ž…๋‹ˆ๋‹ค. ํŠนํžˆ ์ž์—ฐ์–ด ์ฒ˜๋ฆฌ(NLP)์™€ ๊ฐ™์€ ๋ถ„์•ผ์—์„œ ๋›ฐ์–ด๋‚œ ์„ฑ๋Šฅ์„ ๋ฐœํœ˜ํ•˜๋ฉฐ, ์ด ํ™œ์„ฑํ™” ํ•จ์ˆ˜์—์„œ ํŒŒ์ƒ๋œ ์—ฌ๋Ÿฌ ๋ณ€ํ˜•๋“ค์ด ์—ฐ๊ตฌ๋˜์—ˆ์Šต๋‹ˆ๋‹ค. ์ด๋ฒˆ ๊ธ€์—์„œ๋Š” GLU์™€ ๊ทธ ๋ณ€ํ˜•๋“ค,...

[Paper Review] NLP ๊ณต๋ถ€ํ•˜๋Š” ์‚ฌ๋žŒ์ด๋ผ๋ฉด ๊ผญ ์ฝ์–ด์•ผํ•˜๋Š” ๋…ผ๋ฌธ ๋Œ€์‹  ์ •๋ฆฌํ•ด๋“œ๋ฆฝ๋‹ˆ๋‹ค

โœ๏ธ ์ž์—ฐ์–ด ์ฒ˜๋ฆฌ(NLP)๋Š” ๋น ๋ฅด๊ฒŒ ๋ฐœ์ „ํ•˜๊ณ  ์žˆ๋Š” ๋ถ„์•ผ๋กœ, ์ˆ˜๋งŽ์€ ํš๊ธฐ์ ์ธ ์—ฐ๊ตฌ ๋…ผ๋ฌธ๋“ค์ด ๋งค๋…„ ๋ฐœํ‘œ๋˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค. ๋งŒ์•ฝ ์—ฌ๋Ÿฌ๋ถ„์ด NLP์— ์ฒ˜์Œ ๋ฐœ์„ ๋“ค์ด๊ฑฐ๋‚˜, ์—ฐ๊ตฌ๋ฅผ ๋” ๊นŠ์ด ์ดํ•ดํ•˜๊ณ ์ž ํ•œ๋‹ค๋ฉด, ๋‹ค์Œ์— ์†Œ๊ฐœํ•  ๋…ผ๋ฌธ๋“ค์ด ํ•ต์‹ฌ ๊ฐœ๋…๊ณผ ์ตœ๊ทผ ๋ฐœ์ „ ๋™ํ–ฅ์„ ํŒŒ์•…ํ•˜๋Š” ๋ฐ ํฐ ๋„์›€์ด ๋  ๊ฒƒ์ž…๋‹ˆ๋‹ค. ๋‹ค์Œ์€ ํ•ด๋‹น ๋ธ”๋กœ๊ทธ์—์„œ ์†Œ๊ฐœํ•˜๋Š” โ€œMust-Read Res...

[Paper Review] Mamba2 - Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality

๋งํฌ : https://arxiv.org/pdf/2405.21060 ๋‹ค์Œ์€ ๋…ผ๋ฌธ โ€œTransformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Dualityโ€์˜ ๊ฐ ์ฑ•ํ„ฐ๋ณ„๋กœ ์ž์„ธํ•œ ๋ฆฌ๋ทฐ ๋ฐ ์ •๋ฆฌ์ž…๋‹ˆ๋‹ค. 1. Introdu...

[Paper Review] An Image Is Worth 16x16 Words : Transformers for Image Recognition at Scale (Vision Transformer)

์„ ์ • ์ด์œ  ์•ˆ๋…•ํ•˜์„ธ์š”! ์˜ค๋Š˜ ๋…ผ๋ฌธ๋ฆฌ๋ทฐ, ์ฝ”๋“œ๋ฆฌ๋ทฐํ•ด๋ณผ ๋…ผ๋ฌธ์€ โ€œAn Image Is Worth 16x16 Words: Transformers for Image Recognition at Scaleโ€ ๋กœ, ์ปดํ“จํ„ฐ ๋น„์ „์—์„œ Transformer์™€ Attention์ด ์“ฐ์ด๊ฒŒ ๋œ ๊ฒฐ์ •์  ๊ณ„๊ธฐ(?)๊ฐ€ ๋œ ๋…ผ๋ฌธ์ž…๋‹ˆ๋‹ค. ์ตœ๊ทผ ์ด์ชฝ ๋ถ„์•ผ์— ๊ด€์‹ฌ์ด ๋งŽ๋‹ค ๋ณด๋‹ˆ ์˜ค๋Š˜์€ ...