The Korean Society Of Automotive Engineers
[ Article ]
Transactions of the Korean Society of Automotive Engineers - Vol. 34, No. 8, pp.947-960
ISSN: 1225-6382 (Print) 2234-0149 (Online)
Print publication date 01 Aug 2026
Received 29 Dec 2025 Revised 01 Mar 2026 Accepted 12 Mar 2026
DOI: https://doi.org/10.7467/KSAE.2026.34.8.947

자율주행 실시간 객체 탐지를 위한 경량 임베디드 모델의 실증 연구

안광림 ; 최준 ; 봉은정 ; 기석철*
충북대학교 지능로봇공학과
Lightweight Embedded Model for Real-Time Object Detection in Autonomous Driving
Gwangrim Ahn ; Jun Choi ; Eun-Jung Bong ; Seok-Cheol Kee*
Department of Intelligent Systems and Robotics, Chungbuk National University, Chungbuk 28644, Korea

Correspondence to: *E-mail: sckee@chungbuk.ac.kr

Copyright Ⓒ 2026 KSAE / 249-09
This is an Open-Access article distributed under the terms of the Creative Commons Attribution Non-Commercial License(http://creativecommons.org/licenses/by-nc/3.0) which permits unrestricted non-commercial use, distribution, and reproduction in any medium provided the original work is properly cited.

Abstract

Autonomous driving technology has rapidly advanced in recent years, making real-time object detection a critical component of driving safety. Particularly, the reliable recognition of small objects such as traffic lights and traffic signs is essential for timely decision-making in urban driving environments. However, state-of-the-art object detection models typically require high computational resources, which limits their deployment on embedded platforms with limited hardware resources. In this study, a lightweight YOLOv10-based object detection model is proposed by integrating LiteFocusAttention and a re-parameterized Multi-Branch structure to enhance feature representation for small objects while maintaining computational efficiency. The proposed model was deployed on an embedded platform (Jetson Orin Nano) and validated using real-world driving data collected from an onboard camera system. A quantitative evaluation using a ground-truth dataset constructed from real driving scenarios shows that the proposed model improves the small-object detection performance compared to the baseline while maintaining real-time inference at approximately 25 FPS. A qualitative analysis under diverse conditions, including daytime, nighttime, and post-snow environments, demonstrates more stable detection of distant small objects. These results indicate that the proposed model achieves a task-oriented balance between detection accuracy and real-time performance for embedded autonomous driving systems.

Keywords:

Autonomous driving, Real-time object detection, Lightweight model, Attention module, Multi-branch architecture

키워드:

자율주행, 실시간 객체 탐지, 경량화 모델, 어텐션 모듈, 다분기 구조

1. 서 론

자율주행 시스템의 인지 단계는 주변 환경을 정확하게 이해하고 판단하기 위한 핵심 과정이다. 그중 객체 인식은 주행 의사결정 및 제어 신뢰성 확보를 위한 기반 기술이다.1) Fig. 1과 같이 차량 주변의 다양한 객체를 탐지함으로써 자율주행 차량이 주행 상황을 이해하고 의사결정을 수행할 수 있게 한다.2)

Fig. 1

Conceptual diagram of autonomous driving decision making

특히 신호등·교통 표지판과 같은 소형 객체는 도심 도로에서 진행·정지 판단, 속도 유지, 차로 변경 등 핵심 주행 판단에 직접적인 영향을 미치기 때문에 정확한 탐지가 반드시 필요하다. 이러한 소형 객체의 탐지가 실패하면 적색 신호 미인지로 인한 교차로 진입 사고, 제한속도 표지판 미인지로 인한 과속, 차로 변경 판단 오류 등 주요 안전 문제로 이어질 수 있다. 그러나 소형 객체는 영상 내 점유 픽셀 수가 작고 원거리·야간·역광 등의 조건으로 인해 대비가 낮아 검출 난이도가 높다. 또한 도심지 간판, 광고물 등 복잡한 배경 요소는 오탐 및 미탐을 유발하여 탐지 정확도를 저하시킨다. 이러한 특성 때문에 소형 객체 탐지는 크기가 큰 객체를 탐지하는 것보다 기술적 난이도가 높다는 문제가 존재한다.

최근 딥러닝 기반 객체 탐지 기술은 Fig. 2와 같이 CNN 계열 모델과 Transformer 계열 모델을 중심으로 발전해 왔다. CNN 기반 모델 중 대표적인 YOLO(You Only Look Once)계열은 계속 발전하면서 정확도와 구조적 효율성이 개선되었다. 그러나 모델의 발전과 함께 파라미터 수, 연산량이 증가하여 자율주행차에 적용되는 임베디드 환경에서 자원 부족 문제의 가능성이 커지고 있다.

Fig. 2

Comparison of COCO mAP and latency of object detection models

한편, Transformer 기반 객체 탐지 모델(DETR3) 계열)은 Self-Attention 구조를 활용하여 이미지 전역적 문맥 정보를 처리할 수 있어 표현력이 우수하지만, Attention 연산의 높은 연산량과 메모리 요구량 때문에 임베디드 시스템 적용에는 한계가 존재한다. 실제 실측 실험에서 RT-DETR R50 모델(FP16)은 Jetson Orin Nano Dev Kit(8 GB), ROS2 기반 환경에서 약 23.8 FPS의 추론 속도를 보였다. 이는 일반적인 실시간 자율주행 시스템 요구 수준인 25 FPS에 미치지 못하는 성능으로, Transformer 기반 모델이 임베디드 환경에서 실시간성 확보가 쉽지 않다는 점을 증명한다.

자율주행에 활용되는 임베디드 시스템은 전력, 연산 자원, 메모리 측면에서 제약이 크다. 예를 들어 Jetson Nano는 4 GB GPU 메모리로 연산 능력이 제한적이며, Jetson Orin 시리즈 또한 전력, 발열 제약으로 고성능 모델을 장시간 안정적으로 구동하기 어렵다는 문제가 존재한다. 이러한 제약은 지속적 실시간 연산 환경에서 크게 나타난다.

위와 같은 이유로 임베디드 자율주행 시스템에서 실시간 객체 인식 구현을 위해 경량화 및 소형 객체 검출에 강한 모델이 요구된다. 따라서 본 논문에서는 객체 검출 모델의 경량화와 소형 객체 검출에 강한 모델의 개발을 위하여 경량 Attention, Multi-Branch 구조 모듈을 적용한 YOLOv10 기반 모델을 제안하고, 임베디드 환경에서 파라미터 수, 추론 속도 등의 성능 지표를 실증해 모델의 실시간 처리 가능 여부를 분석하고자 한다.


2. 관련 연구

2.1 객체 검출 모델

객체 탐지 기술은 입력된 이미지나 영상에서 특정 객체의 위치와 종류를 동시에 인식하는 기술로, 자율주행을 비롯해 산업 자동화, 감시 시스템, 로보틱스 등 다양한 분야에서 활용되고 있다. 특히 자율주행 환경에서는 도로 위의 차량, 보행자, 신호등 등 다양한 객체를 정확하고 신속하게 인식해야 하며, 이를 통해 주행 경로 설정과 상황 판단이 가능케 한다. 이런 이유로 인해 객체 탐지 기술은 정확도와 실시간성, 경량성 측면에서 지속적으로 발전해왔다. 초기 객체 탐지 모델은 주로 슬라이딩 윈도우4) 방식과 수작업으로 설계된 특징 추출기에 의존하였다. 대표적인 예시로 Fig. 3에서 볼 수 있는 HOG,5) SIFT6)와 같은 전통적 특징 추출 방법이 있다. 그러나 이러한 방법은 다양한 객체의 형태, 환경 변화를 효과적으로 반영하기 어려웠고, 실시간 처리에 한계가 있었다. 이후 딥러닝 기반의 합성곱 신경망(CNN7))이 도입되고 One-Stage 구조의 YOLO, SSD,8) Two-Stage 구조의 R-CNN,9) Faster R-CNN10) 등 네트워크가 발전하여 객체 탐지 기술은 큰 전환점을 맞이하였다.

Fig. 3

Example of HOG and SIFT-based feature extraction results

One-Stage 구조의 YOLO는 2016년 첫 번째 버전인 YOLOv111)이 발표된 이후 지속적으로 개선되며 발전해왔다. 최근의 YOLOv1012)은 이전 버전 대비 효율성을 강조한 구조로 설계되어, 정확도와 연산 효율성의 균형을 추구하는 방향으로 발전하였다. 이러한 발전 과정은 단순히 정확도 향상을 넘어, 실제 환경에서의 실시간 적용 가능성을 높이기 위한 흐름으로 이어지고 있다.

Fig. 4

Architecture of Yolov10

2.2 실시간 처리를 위한 경량화 연구

기존 고성능 모델은 정확도 측면에서 우수하지만, 자율주행 차량과 같이 하드웨어 제약이 있는 환경에서는 실시간 처리가 어렵다는 한계가 있다. 이를 해결하기 위해 모델의 크기를 줄이고 연산량을 줄이는 다양한 기법들이 연구되어왔다.

대표적인 방법으로 Pruning13)과 Quantization14)이 있다. Pruning은 학습된 모델에서 중요도가 낮은 파라미터나 채널을 제거하여 연산량을 줄이는 기법이며, Quantization은 파라미터의 표현 정밀도를 낮추어 메모리 사용량을 줄이고 연산 효율을 높이는 방식이다. 모델 구조 자체를 변경하지 않고 경량화를 실현할 수 있어, 실시간 처리가 필요한 환경에서활용되고 있다.

또한 네트워크 구조 자체 경량화 방법이 연구되고 있다. 대표적으로 MobileNet,15) ShuffleNet16) 등 경량화 Backbone 네트워크는 Fig. 5와 같이 입력 채널별로 개별 필터가 적용되어 연산량을 감소시키는 Depthwise Conv을 기반으로 하여 기존의 복잡한 합성곱 연산을 효율적으로 줄여 적은 연산량으로 충분한 특징 추출이 가능하도록 설계되었다. 최근에는 YOLO 계열 모델에도 경량화 Backbone과 효율적 Neck 구조가 적용되면서, 일부 모델의 임베디드 환경에서 동작 가능 수준의 경량화가 이루어지고 있다.

Fig. 5

Concept of computation in Depthwise convolution

2.3 소형 객체 탐지의 기술적 과제와 접근 방법

한편 소형 객체 탐지는 여전히 해결해야 할 중요한 과제 중 하나로 남아 있다. 소형 객체는 영상에서 차지하는 픽셀 수가 적어 Feature 정보가 부족하고, 배경과의 구분도 어렵기 때문에 정확한 탐지가 쉽지 않다. 이러한 문제는 특히 자율주행 환경에서 심각하게 나타난다. 교통 표지판이나 신호등은 실시간으로 인식하지 못하면 사고로 이어질 가능성이 높다. 이를 해결하기 위해 Fig. 6의 FPN,17) PANet,18) BiFPN19) 등 다단계 Feature fusion 기법을 활용하고 있으며, 최근 다양한 해상도에서 객체 정보를 통합해 탐지 성능을 높이기 위해 Multi-Branch 구조의 연구도 활발히 이뤄지고 있다.

Fig. 6

Architectures of FPN, PANet, and BiFPN

Attention 메커니즘은 네트워크가 입력 이미지의 모든 영역을 균등히 처리하지 않고, 중요한 영역에 더 많은 연산 자원을 집중하도록 설계된 기법이다. 이를 통해 네트워크는 불필요한 연산을 줄이고 의미 있는 Feature를 더 정밀하게 추출할 수 있다. 이러한 방식은 경량화, 정확도를 동시에 추구할 수 있는 장점이 있어 객체 탐지 분야에서 주목받고 있다.

본 연구에서는 이러한 연구 동향을 바탕으로 YOLOv10 기반의 경량화 모델에 LFA20) 및 Multi-Branch 구조를 적용하였다. YOLOv10은 기본적으로 효율성을 중시하는 설계로, 실시간성 확보에 유리한 구조를 가지고 있다. LFA를 적용함으로써 중요한 Feature 영역에 집중할 수 있도록 하고, Multi-Branch 구조를 통해 특징 표현력을 강화한 경량 모델을 제안한다. 또한, 제안 구조를 실제 임베디드 환경에 적용하고 실증적으로 평가함으로써, 자율주행 시스템에서의 활용 가능성을 검증하고자 한다.


3. 모델 구조 및 구현

본 연구에서는 YOLOv10의 구조에 Backbone 및 Neck 단계의 중간 Feature에 대해 소형 객체의 표현력을 강화하고 연산 효율성을 향상하는 모듈을 적용한 실시간성 확보를 위한 구조를 제안하고자 한다.

3.1 모델 구성 개요

Fig. 7은 본 연구에서 사용된 전체 모델의 구성도를 나타낸다. YOLOv10의 기본 Backbone과 Neck 흐름을 유지하면서, 특정 Feature 단계에 LFA와 AIM, 그리고 REMBC 모듈을 삽입하였다. 이 구조는 기존 YOLOv10 대비 적은 파라미터로 정보 표현력을 최대한 유지시켜 경량화를 이루면서도 소형 객체에 대한 검출 정확성이 높은 모델을 목표로 설계되었다.

Fig. 7

Proposed model overall architecture

3.2 연구 개발 및 적용 모듈

본 연구에서는 YOLOv10 기반 구조에 LFA, AIM, MBC, REMBC 네 가지 개발 모듈을 적용하였다. LFA–AIM은 Attention 기반 정보 강화 모듈이며, MBC–REMBC는 합성곱 기반의 Feature 표현력 향상 및 효율화 모듈이다. 해당 모듈들은 Neck 단계의 중간 경로에 결합되어 소형 객체 탐지 성능을 실질적으로 향상시키는 역할을 수행한다.

3.2.1 LiteFocusAttention (LFA)

LFA 모듈은 입력 Feature map 내에서 중요한 공간 영역을 선택적으로 강조하여, 소형 객체와 같이 미세한 구조적 정보를 유지하면서 연산 효율을 확보하기 위해 설계되었다. 기존 Self-Attention은 모든 공간 위치에 대해 Query–Key 유사도를 계산하기 때문에 높은 표현력을 가지지만, Feature 해상도가 큰 단계에서는 연산량이 급격히 증가하는 단점이 있다. LFA는 이러한 문제를 해결하기 위해, AIM에서 생성된 중요도 기반 Mask를 활용해 선별된 공간 위치에 대해서만 Attention 연산을 수행하는 경량화 Spatial attention 메커니즘이다.

Fig. 8

Architecture of LFA

Fatt =Softmax(Qmasked Kmasked Td)V(1) 

여기서 d는 Feature 차원을 의미하며, QmaskedKmasked는 AIM을 통해 선택된 위치만을 반영한 Masked Query 및 Key이다. Attention 출력은 중요 공간 영역에서의 특징을 강화하여 소형 객체의 탐지 성능 향상에 기여한다.

계산된 Attention feature는 원본 Feature와의 결합을 위해 Concat을 수행하며, FFN을 통해 비선형적 Feature를 재조정한다. Attention 출력을 정규화하고 채널 특징을 재배치하여 최종 표현력을 안정화한다. 최종 Feature는 다음과 같이 정의된다.

Fout =FFN([Fatt V])(2) 

여기서 [⋅∥⋅]는 Concatenation 연산을 의미한다. 이후 Residual 연결을 통해 입력 Feature와의 정보 손실을 방지하고 학습 안정성을 확보한다. Residual 특성을 반영한 LFA의 최종 출력 Feature는 다음과 같다.

Fout =Fe+Conv1×1(Fatt )(3) 

이 과정을 통해 LFA는 Attention 기반의 공간적 선택성과 CNN 기반의 지역적 구조 분석을 동시에 반영하여, 소형 객체의 표현력을 향상시키면서도 전체 연산량을 억제한다.

3.2.2 Adaptive Importance Mask (AIM)

AIM은 입력 Feature map내에서 공간적 중요도를 추정하여 Attention 연산을 선택적으로 수행하도록 설계된 모듈로, LFA의 핵심 전처리 단계로 기능한다. AIM은 입력 Feature로부터 전체적 문맥(Global context)을 추출하고, 이를 이용하여 각 공간 위치의 상대적 중요도를 나타내는 단일 채널 중요도 맵을 생성한다. 생성된 중요도 맵은 Query 및 Key 연산에 직접 적용되어, Attention 과정에서 연산이 수행되는 위치를 제한하여 연산량을 감소시킨다.

AIM (Fig. 9)의 첫 단계는 1×1 Convolution과 Sigmoid 활성화를 이용하여 중요도 맵 I를 계산하여 공간적 중요도를 추정한다. 이후 Global average pooling을 통해 채널 차원을 축소한다.

I=σ(Conv1×1(Fe))(4) 
Fig. 9

Architecture of AIM

중요도 맵 I는 공간 위치의 상대적 중요성을 나타낸다. Query, Key projection에 곱해져 연산 영역을 조정하는 Soft mask 역할을 수행한다. Attention 연산을 위한 Query와 Key는 다음과 같이 중요도 Mask와의 요소별 곱을 통해 선택적 강조가 이루어진다.

Qmasked =QM,Kmasked =KM(5) 

여기서 ⊙는 요소별 곱을 의미한다. 이 과정을 통해, LFA는 전체 Feature map에 대해 Dense attention을 수행하는 것이 아니라, AIM이 선택한 소수의 공간 영역에 집중하여 연산 효율을 높이면서도 중요한 Feature 정보를 보존할 수 있다. 소프트 마스크 방식은 Feature map의 채널별·공간별 활성도(Activation) 및 Gradient 기반 통계 값을 입력으로 사용하여 중요도를 연속적 가중치 형태로 산출한다. 구체적으로, AIM은 입력 Feature에 대해 채널 축소(1 × 1 Conv) 및 Global average pooling을 수행하여 위치별 상대적 중요도를 계산하고, 이를 Sigmoid 기반의 Soft Mask로 변환한다. 따라서 마스크 값은 객체가 존재하는 국소 영역에서 일반적으로 더 높은 Activation을 갖기 때문에 학습 과정에서 소형 객체 위치에 자연스럽게 더 가중치가 부여된다.

본 연구에서는 실시간성 확보를 위해 Soft mask를 기본으로 사용하되, Mask 값의 분포가 소형 객체 영역에 집중되도록 학습 중 Backpropagation을 통해 자동적으로 보정된 AIM은 선택적 연산 구조를 활용하기 때문에 Attention 연산의 효율화를 위한 요소로 작동하여 실시간 처리성을 높인다. 또한, LFA 모듈과 결합하여 소형 객체에 대한 Feature를 강화하는 역할을 수행한다.

3.2.3 Multi-Branch Convolution (MBC)

1) MBC Branch 구조

MBC는 제한된 연산량 내에서 Feature를 효율적으로 통합하기 위해 설계된 병렬 합성곱 기반 구조이다. 단일 경로 합성곱에 의존하는 기존 Feature fusion 방식은 다양한 객체 크기와 복잡한 배경 정보를 동시 처리하거나 소형 객체가 포함된 장면에서는 풍부한 표현력을 확보하기 어렵다. MBC는 이러한 문제를 해결하기 위해 서로 다른 수용 범위, 특징 추출 특성을 가진 연산 분기를 병렬 구성하여, 입력 Feature에 대한 다각적 표현을 제공한다. Fig. 10은 제안된 MBC 구조를 나타낸다.

Fig. 10

Architecture of MBC

MBC는 세 가지 Depthwise Conv와 두 가지 보조 분기로 구성된다. DWConv의 경우 d = 1은 기본 로컬 정보 추출, d = 2는 중간 범위의 문맥 정보 반영, d = 3는 더 넓은 수용 영역 확보를 수행하는 세개의 경로로 분기된다. 각 Depthwise 연산 후에는 1 × 1 Pointwise convolution을 적용하여 채널 간 결합을 보완한다. 이 구조는 지역적·전역적 정보를 동시에 포착할 수 있도록 설계되었다.

GhostConv는 채널 생성 비용을 줄이기 위해 고안된 경량 합성곱 구조로, 1 × 1 Convolution으로 주요 Feature를 추출한 뒤, 추가적인 3 × 3 Ghost feature를 생성하여 표현력을 확장한다. 이를 통해 파라미터 증가를 최소화하면서도 다양한 Feature 변형을 효율적으로 반영할 수 있다.

추가 분기로 Sobel 필터 기반의 Edge Conv를 사용하여 객체 경계 및 윤곽 정보를 강화한다. 이는 신호등, 교통 표지판과 같은 소형 객체가 배경과 혼재하는 상황에서 경계 기반 단서를 강조하여 소형 객체에 대한 탐지 안정성을 향상시키는 데 효과적이다.

2) Softmax Gating 기반 Branch Aggregation

다섯 개 Branch에서 추출된 Feature는 단순한 Concat이 아니라 Softmax gating을 통해 가중합 형태로 통합된다. Softmax gating은 학습을 통해 각 Branch의 상대적 중요도(Salience score)를 학습하고, 장면에 따라 특정 Branch의 비중을 자동 조정한다. 이는 고정된 Feature fusion 방식보다 높은 표현력과 유연성을 제공한다. 최종 출력 Feature는 다음과 같이 정의된다. αi, βi는 각 Softmax 기반 가중치, Branch 연산을 의미한다.

Fout =Fe+i=1n𝛼iBi(Fe)(6) 

Softmax 가중치는 다음과 같이 계산된다.

𝛼i=exp(si)j=1nexp(sj)(7) 

여기서 si는 각 Branch의 중요도를 나타내는 학습 가능한 Scalar parameter이다. MBC는 다양한 Dilation을 통한 로컬–글로벌 정보 동시 확보, Edge·ghost 특징 결합을 통한 소형 객체 탐지 강화, Softmax gating 기반의 적응형 Feature fusion, Depthwise 설계로 연산량 증가 최소화를 수행한다.

3) Re-parameterized Multi-Branch Convolution (REMBC)

Fig. 11은 제안된 REMBC의 개념적 구조를 보여준다. 학습 단계에서는 서로 다른 Dilation을 가진 DWconv 등 다섯 개의 분기가 입력 Feature를 각각 처리하여 풍부한 표현을 학습한다. 추론 단계에서는 이 모든 분기가 하나의 Conv kernel로 병합되어 단일 경로로 처리됨으로써 연산량과 메모리 사용량이 절감된다.

Fig. 11

Architecture of REMBC

y=Conv3×3(x;Wrep ,brep ,)(8) 

여기서 Wrepbrep는 모든 Branch의 파라미터가 합성된 Re-parameterized weight와 Bias이다. 해당 과정은 모델의 표현력을 그대로 유지하면서도 추론 경로를 단순화할 수 있는 Re-parameterization 기법이며, 특히 Jetson Orin과 같은 자원 제약 환경에서 실시간성을 확보하는 데 매우 효과적이다.


4. 실험 구성

4.1 학습 및 추론 환경

본 연구에서는 제안된 경량화 객체 탐지 모델의 실시간 임베디드 적용 가능성을 검증하기 위해 학습 환경과 추론 환경을 분리하여 설계하였다. 학습은 고성능 GPU 환경에서 진행하고, 추론은 임베디드 보드 상 실시간 동작을 검증하였다.

1) 학습 환경 구성

모델 학습은 PyTorch 프레임워크를 기반으로 진행되었으며, GPU 환경은 NVIDIA L4 24 GB VRAM을 갖춘 워크스테이션을 사용하였으며, Batch size는 16, Input size 640 × 640, 150 Epochs 모델 학습을 진행하였다.

데이터셋은 COCO2017,21) BDD100K22)를 활용하였다. 이는 신호등·보행자와 같은 소형 객체의 분포가 높은 장면이 있으며, 다양한 주행 상황에 대응할 수 있도록 많은 장면을 포함한다. Mosaic, Random affine, HSV Augmentation, Horizontal flip 등 다양한 데이터 증강 기법을 적용하여 모델 일반화 성능을 강화하였다. 소형 객체가 잘 학습되도록 하기 위해 Mosaic 비율과 객체 최소 크기를 조정하였다.

2) 모델 변환 및 최적화

학습 완료 후 모델은 임베디드 보드에서 실시간 추론이 가능하도록 경량화 및 최적화 과정을 거쳤다. TensorRT 최적화를 통해 FP16 정밀도 기반의 추론 엔진을 생성하였다.

3) 임베디드 추론 환경

추론 실증 실험은 NVIDIA Jetson Orin Nano Dev Kit 8 GB에서 수행하였다. 해당 보드는 자율주행 플랫폼의 실시간 처리 환경을 모사하기 위해 선택되었다. 추론 세부 사양은 ARM Cortex-A78 CPU / 8 GB LPDDR5 / CUDA 12.2, Ubuntu 20.04 + JetPack SDK, TensorRT FP16 엔진 기반 추론, TensorRT + OpenCV 처리 추론 프레임워크로 구성되었다. 실시간 추론 파이프라인은 카메라 영상 입력 후, 전처리, 모델 추론, 시각화 출력 과정의 지연시간으로 실시간 처리 조건을 만족하는지를 평가한다.

4.2 실증 환경 및 객체 구성

본 연구의 목적은 제안된 경량화 객체 탐지 모델이 실제 주행 환경에서 실시간으로 소형 객체를 안정적으로 탐지할 수 있는지를 검증하는 것이다. 따라서 데이터셋 기반의 실험이 아닌, 실제 카메라를 활용한 실증 환경을 구축하였다.

Fig. 12

Experimental vehicle used for real-world validation (left: overall view of the vehicle, right: sensor-mounted configuration)

본 실험은 실제 주행 환경에서 제안 모델의 객체 탐지 성능을 검증하기 위해 실차 기반 데이터 수집 환경을 구축하였다. 실험 차량은 라이드플럭스23)에서 제공한 아이오닉 EV 플랫폼을 사용하였으며, 카메라는 차량 진행 방향 기준 좌우 각도 0°, 상하 각도 −3°로 설정하였으며, 차량 정면으로부터 2.67 m, 지면으로부터 1.74 m 지점 차량 상부에 장착되었다. 차량 중심선과 정렬되도록 설치하여 주행 중 시야 편차를 최소화하였다. 또한 진동에 의한 각도 변화가 발생하지 않도록 고정 브래킷을 사용하였다.

카메라의 영상은 1920 × 1080 해상도, 100 Hz로 수집되었으며, 모델 입력은 640 × 640으로 리사이즈하여 사용하였다. 실시간 영상은 ROS2 기반 파이프라인을 통해 Jetson으로 전달하여 객체 탐지 추론을 수행하였다.

실차 주행 실험은 충북대학교 C-track 도심 구간과 외부 순환로에서 수행되었으며, 도심 구간에서는 약 30 km/h, 외부 순환로에서는 약 50 km/h 내외의 속도 범위로 주행하였다. 실험은 주간 및 야간 환경에서 수행되었으며, 기상 조건은 맑은 상태와 강설 후 조건을 포함하였다. 또한, 정량 평가를 위한 GT는 6,236 Frames로 구성되었으며, Table 1에 해당하는 약 2 ~ 130 m 범위 내의 객체를 대상으로 라벨링하였다. 다양한 환경에서의 검증을 위해 시간, 날씨에 따른 데이터셋을 Table 2와 같이 구성하였다. 해당 데이터는 모델 학습에는 사용하지 않고 성능 검증에만 활용하였다.

Ground Truth components

Ground Truth dataset statistics

4.3 실증환경 평가 지표 및 측정 항목

실증 환경에서는 학습 정확도나 Validation 성능보다 주행 환경에서의 탐지 안정성, 속도, 반응성이 매우 중요한 평가 요소이다. 이에 따라 Latency, FPS, 하위 N% FPS 측정을 중심으로 실험을 진행하였다. 또한 실차 환경에서의 객체 탐지 정확도를 정량적으로 평가하기 위해 GT 데이터셋을 대상으로 mAP@50, Precision, Recall을 산출하였다.

4.4 실증 시나리오 및 실험 절차

실증 실험은 실제 주행 환경을 모사하여 설계되었다. 주행 구간은 충북대학교 자율주행차 테스트 베드 C-track 도심구역 및 외부 순환로로 구성되었다.

4.4.1 실증 시나리오 구성

본 연구에서는 제안 모델의 실시간 임베디드 적용 가능성을 검증하기 위해 학습과 추론 환경을 분리 설계하였다. 학습은 고성능 GPU 환경에서 진행하고, 추론은 Jetson Orin nano 임베디드 보드에서 실시간 동작을 검증한다.

Configuring empirical scenario

4.4.2 실험 절차

실험 절차는 차량 전방 실시간 카메라 영상 수집, 영상 리사이즈 및 전 처리 후 TensorRT FP16 모델 입력, 모델 추론 및 Bounding box 산출, 시각적 검증 및 시나리오별 단위 측정 지표 집계로 이뤄진다.

4.4.3 비교 기준

Baseline인 YOLOv10s 모델과 제안모델 (YOLOv10 + LFA + REMBC)에 대해 분당 평균 FPS와 이에 대한 추세선, 하위 n% FPS, Ground truth 기반의 mAP@50, Precision, Recall을 중심으로 성능을 비교하였다.

4.5 벤치마크 실험 구성

4.5.1 벤치마크 시나리오 구성

실증 환경 실험과 별도로, 제안 모델의 일반적 객체 탐지 성능을 평가하기 위해 벤치마크 데이터셋 실험을 수행하였다. 벤치마크 데이터셋은 실제 주행환경 테스트와 달리 다양한 조건에서 성능을 검증할 수 있어, 모델의 보편성과 일반화 성능을 측정할 수 있는 기준이 된다.

Benchmark DB configuration

COCO Dataset은 Fig. 13과 같이 80종류의 다양한 Class를 보유한 데이터 세트로 다수 객체 인식 알고리즘에서 표준적인 벤치마킹으로 활용되는 데이터셋이다. BDD100K는 버클리 대학이 수집한 데이터셋으로, Fig. 13과 같이 주행 상황에 필요한 차량, 보행자 등 10종류 Class로 구성되어 자율주행 객체인식 알고리즘의 일반화 성능을 검증할 수 있다. 벤치마크 실험에서는 GT 기반 정량평가가 가능해 정량 성능 비교가 가능하다. 평가 지표는 mAP50-95(COCO), mAP50(BDD), Parameters, 추론시간을 포함하였다.

Fig. 13

Dataset sample images

4.5.2 벤치마크 비교 모델 구성

각 모듈 간 영향성을 분석하기 위해 벤치마크 데이터셋을 활용한 Ablation 실험을 진행하였다. 벤치마크 비교를 위한 모델은 아래 표와 같이 구성되었다.

Benchmark comparison model configuration


5. 실험 결과 및 분석

5.1 실시간 성능 평가

5.1.1 실험 방법 및 환경

실시간 성능 평가는 4장에서 구축한 실증 주행 환경과 Jetson Orin 추론 파이프라인을 적용하여 이루어졌다. 본 실험에서는 End-to-End 실시간 처리 성능을 평가하기 위해 분당 평균 FPS 항목을 측정하고, 이에 대한 변화 분석을 통해 임베디드 환경에서 제안 모델의 실시간성 및 안정성을 검증하고자 하였다.

Fig. 14Table 6은 실증 환경에서 측정한 FPS 결과를 나타낸다. 장시간 검출 시나리오인 S2 시나리오 추론에서 특히 Throttling 영향이 크게 나타났으나, 제안 모델은 실시간 객체 검출 파이프라인 End-to-End 처리 기준으로 평균 약 24.9 FPS를 기록하여 자율주행차 실시간 처리 기준 25 FPS에 근접한 성능을 확보하였다.

Fig. 14

Empirical test FPS measurement results

Empirical experiment results (average FPS)

실증 주행 환경은 ROS2 메시지 처리 비용, 스레드 스케줄링, Jetson의 Throttling 등이 복합적으로 작용하여 0.5 ~ 1 FPS 수준의 성능 저하가 발생하였다. 이로 인해 Baseline model이 약 23.2 ~ 23.8 FPS의 처리 속도를 보였고, 이에 대비하여 제안 모델은 약 1.5 ~ 2.0 FPS 향상된 추론 속도를 유지하였다. 추세선 기울기 차 분석에서도 FPS 저하 폭이 Baseline 대비 작아 제안된 모듈 구조의 연산 경량화 효과가 임베디드 보드 기반 실증 환경에서 유효함을 확인하였다.

5.2 하위 n% FPS 측정

5.2.1 실험 방법 및 환경

Jetson Orin Nano는 장시간 연속 추론 시 발열 및 자원 점유율 증가로 인해 성능 저하가 발생할 수 있다. 따라서 장시간 주행 환경에서 하위 5 %, 10 % FPS 분포를 분석하여 임베디드 환경에서의 안정성을 분석하였다.

5.2.2 실험 결과

실증 결과인 Fig. 14Fig. 15를 분석하였을 때, 장시간 추론 환경에서 두 모델 모두 약 40분 이후 FPS 저하가 발생하였으며, Jetson의 Throttling으로 인한 현상이다. 그러나 FPS 하락 폭과 최소 처리 성능 구간에서는 두 모델간 차이가 나타났다. Baseline은 장시간 추론 시 안정적 FPS 유지가 어려워졌으며, 하위 10 % 22.706, 하위 5 % 22.647의 FPS를 보였다. 실시간 처리 기준(25 FPS)에 미치지 못하는 수준으로, 장시간 추론 환경에서는 성능 저하가 누적되는 경향을 보였다. 반면 제안 모델은 연산량을 낮추는 LFA의 중요도 기반 선택 연산과 연산 경로를 단순화하는 REMBC 구조로 인해 FPS 변동폭이 상대적으로 작게 유지되었다. 하위 10 % 24.385, 하위 5 % 24.300으로 측정되어, 최소 성능 구간에서도 실시간 기준에 근접한 처리 속도를 유지하였다. 이를 통해 제안 모델이 동일 조건에서도 경량화로 인해 장시간 추론에서 더 높은 안정성을 보임을 확인하였다.

Fig. 15

Empirical detection results

5.3 벤치마크 Ablation Study

5.3.1 실험 방법 및 환경

제안 모듈(LFA, AIM, REMBC)의 개별 및 조합 효과를 정량 평가하기 위해 Jetson 환경에서 COCO2017과 BDD100K 데이터셋에서 Ablation 실험을 수행하였다. 모델 구성은 4장 Table 5와 동일하게 적용하여 구성되었다.

5.3.2 실험 결과

LFA, AIM, MBC, REMBC를 단계적으로 적용한 v1–v4 모델을 구성하여 각 모듈의 기여도와 효율성 향상을 분석하였다. 정확도, 파라미터 수, 추론 시간을 기준으로 성능 변화를 비교하였다.

v1 모델은 원본 대비 파라미터 수가 8.06 M에서 7.74 M으로 감소하고, 추론 시간 또한 42.01 ms에서 41.38 ms로 줄어 처리 효율성이 향상되었다. COCO에서 mAP는 0.459에서 0.456, BDD100K에서 0.511에서 0.507로 소폭 감소하였다. LFA가 중요 영역에 집중하는 구조이지만 AIM 없이는 작은 객체나 복잡한 상황에서 정보 손실이 발생할 수 있기 때문이다.

AIM을 추가한 v2 모델은 COCO에서 mAP가 0.458로 증가하였고, BDD100K에서는 0.509로 유지되어 소형 객체 검출의 안정성이 향상되었다. 추론 시간은 41.41 ms로 v1 대비 소폭 증가하였으나, LFA로 인해 감소한 성능을 AIM이 보완하여 정확도–효율성 간 균형점 역할을 수행한다. 이 결과는 AIM의 중요도 기반 Spatial weighting이 소형/원거리 객체 표현력에 직접적으로 기여함을 보여준다.

MBC를 결합한 v3는 파라미터가 6.52 M으로 크게 감소하고 추론 시간 또한 40.42 ms까지 줄어들어 가장 큰 연산 효율 개선 폭을 보였다. 다만, COCO에서 mAP는 0.453으로 감소하고 BDD100K도 0.502로 떨어져 정확성 손실이 나타났다. 이는 Multi-Branch 구조가 DWConv, EdgeConv, GhostConv 등 다양한 수용영역을 제공하지만, COCO2017과 같은 대규모 범용 객체 분포에서는 일부 일반적 패턴의 표현력이 약화될 수 있기 때문으로 해석된다. 그럼에도 소형 객체가 많은 도로 환경에서는 여전히 유효한 구조로 판단된다.

병렬 경로를 Re-parameterized single path로 변환한 v4 모델은 Time이 39.38 ms로 가장 빠른 성능을 기록하였다. 이는 연산 경로 단순화로 인하여 나타난 결과로 자율주행차의 실시간성 보장 기준으로 보고 있는 25 FPS 이상의 처리 속도를 보인다. 정확도는 COCO에서 0.452, BDD100K에서 0.500으로 Baseline 대비 미세한 감소 수준이며, 효율성 증가 폭에 비해 성능 저하는 제한적이다.

Benchmark ablation study results (COCO2017)

Benchmark ablation study results (BDD100K)

Fig. 16은 벤치마크 데이터셋에서 추론 결과이다. 기존 YOLOv10과 거의 비슷한 성능을 보이지만 제안 모델은 COCO 데이터셋에서 차량 안 Person 객체 검출이 가능하였고, BDD100K에선 작은 객체인 Traffic sign 및 Traffic Light에 대해 더 높은 정확성을 보였다. 작은 객체의 검출 정확성이 높아진 것을 확인할 수 있다.

Fig. 16

Benchmark dataset inference results (upper: BDD100K, lower: COCO 2017)

5.4 소형 객체 검출 실험

5.4.1 실험 방법 및 환경

제안 모델의 소형 객체 탐지 성능을 검증하기 위해 BDD100K 데이터셋의 Bounding box 크기 기반 필터링을 수행하였다. 각 객체에 대해 Bounding box의 짧은 변을 계산하였으며, 이 값이 40 px 이하인 경우를 소형 객체, 80 px 이하인 경우를 중형 객체, 80 px 초과의 경우 대형 객체로 정의하였다.

1) BDD100K를 기반으로 한 객체 기준 정의

BDD100K의 신호등, 표지판, 보행자 등 주행환경에 맞는 소형 객체는 영상 특성 및 거리 변화에 따라 대부분 28–40 px 구간에 분포한다. 또한 객체가 40 px 이하가 되면 Edge/Texture 정보의 손실 비율이 급격히 증가하고, Feature semantic 정보가 약해져 오탐 및 미탐 확률이 크게 증가한다. 위와 같은 이유로 탐지 성능 평가를 위해 Detect layer 사이즈와 동일한 40 px을 소형객체, 80 px을 중형객체의 기준으로 규정하였다. Fig. 17은 이에 대한 예시로 빨간 박스는 40 × 40픽셀, 초록박스는 80 × 80픽셀의 정사각형을 나타낸다. 이를 기준으로 소형, 중형, 대형 객체를 구분한다.

Fig. 17

BDD100K small object example

5.4.2 실험 결과

Fig. 18에 나타난 바와 같이, BDD100K 데이터셋을 대상으로 40 px 이하 객체에 대해 소형 객체 탐지 성능을 비교한 결과, 제안된 모델은 YOLOv10s 대비 mAP50 기준 약 7.5 % 향상(0.382 → 0.411)을 보였다. LFA와 REMBC 구조는 소형 객체 Feature 손실을 억제하고, 저해상도 Feature map에서의 표현력을 강화함으로써 기존 YOLOv10s 모델 대비 소형 객체 인식 능력이 향상되었음을 의미한다.

Fig. 18

Small, medium, and large object detection results

Table 9에 나타난 바와 같이, BDD100K 데이터셋을 대상으로 40 px 이하 객체에 대해 소형 객체 탐지 성능을 비교한 결과, 제안된 모델은 YOLOv10s 대비 mAP50 기준 약 7.5 % 향상(0.382 → 0.411)을 보였다. LFA와 REMBC 구조가 소형 객체 Feature 손실을 억제하고, 저해상도 Feature map 표현력을 강화하여 소형 객체 인식 능력이 향상되었다.

Small object detection results (BDD100K)

5.5 실차 환경 정량적 성능 평가

5.5.1 실험 방법 및 환경

실제 주행 환경에서의 알고리즘 유효성 검증을 위해 실차 환경 수집 GT 데이터셋을 이용하여 Baseline(YOLOv10s)과 제안 모델의 객체 탐지 성능을 정량적으로 비교하였다. 평가는 4장에서 기술한 바와 같이 1920 × 1080 해상도의 영상을 640 × 640으로 리사이즈하여 입력으로 사용하였으며, Jetson Orin Nano 기반의 TensorRT FP16 추론 환경에서 수행하였다. 평가에 사용된 데이터는 총 6,236 Frames로 구성되며, 도심 구간과 외부 순환로에서 주간 및 야간, 맑은 날씨와 강설 후 환경을 포함하도록 구성하였다. 정량적 평가 지표로는 AP@50, Precision, Recall을 사용하였으며, 객체 크기별 탐지 성능을 분석 및 검증하기 위해서 5.4.1절에서 정의한 픽셀 크기 기준을 동일하게 적용하였다. 객체 크기별 Precision과 Recall은 또한 정의된 픽셀 기반 객체 크기 기준을 GT Bounding box 크기에 적용하여 conf=0.5, IOU=0.5 기준 AP@50, Precision, Recall을 산출하였다.

5.5.2 실험 결과

Table 10은 실차 환경에서 객체 크기별 정량적 평가 결과를 나타낸다.

Quantitative evaluation results by object size in realworld environment

Small 객체에 대한 AP@50은 Baseline 대비 0.349에서 0.361로 향상되었으며, Precision과 Recall 또한 증가하였다. 이는 제안 모델이 중요 공간 영역에 연산을 집중하는 구조적 특성으로 인해 작은 객체의 특징 표현에 효과적으로 작용했기 때문으로 판단된다.

반면 Medium 및 Large 객체의 AP@50은 소폭 감소하였으며, Precision과 Recall 또한 유사한 경향을 보였다. 이는 제한된 연산 자원 내에서 소형 객체에 대한 특징 강화가 상대적으로 더 많은 표현 용량을 요구함에 따라 중·대형 객체에 대한 표현력이 일부 감소한 결과로 해석된다. 그럼에도 불구하고 제안 모델은 다양한 조도 및 기상 조건이 포함된 실제 주행 환경에서도 객체 크기별 성능 경향이 데이터셋 기반 실험과 유사하게 유지되어 자율주행에서 중요한 소형 객체에 대해 향상된 검출 성능을 보였다.

5.6 실차 환경 정성적 성능 평가

5.6.1 실험 방법 및 환경

정성적 평가는 C-track 도심 구간과 외부 순환로에서 수집된 실차 주행 영상을 대상으로 다양한 객체 위치, 시간, 날씨 환경에서의 객체 탐지 결과를 비교하였다.

Baseline과 제안 모델의 추론 결과를 동일한 프레임에 대해 시각화하여 소형 객체 검출 성능, 원거리 객체 검출 성능, 역광 및 복잡한 배경 등의 환경에서의 탐지 안정성을 중심으로 비교하였다.

5.6.2 실험 결과

Fig. 19는 실제 주행 환경에서 Baseline과 제안 모델의 객체 탐지 결과를 비교한 것이다. 전체적으로 제안 모델은 다양한 환경에서 소형 객체에 대한 검출 안정성이 향상된 것을 확인할 수 있다.

Fig. 19

Qualitative comparison of object detection results in real-world driving environmentLeft: YOLOv10s (Baseline), Right: Ours Model

외부 순환로 주간 환경에서는 도로 곡선 구간의 원거리 교통 표지와 같은 소형 객체에 대해 Baseline 대비 보다 안정적인 검출 결과를 보였다. Baseline의 경우 일부 프레임에서 소형 객체의 검출이 누락, 단일 객체만 검출되는 반면, 제안 모델은 동일한 장면에서 복수 소형 객체를 동시에 검출하는 것을 확인할 수 있었다.

도심 곡선 구간에서는 복잡한 배경과 구조물이 존재하는 환경에서도 제안 모델이 교통 표지를 지속적으로 검출하는 경향을 보였으며, Bounding box의 형상이 보다 안정적으로 유지되었다. 이는 중요 공간 영역에 연산을 집중하는 구조가 배경 정보에 의한 간섭을 줄이고 객체 특징을 강화한 결과로 해석된다.

교차로 주간 환경에서는 원거리 신호등과 보행자에 대해 두 모델 모두 검출이 가능하였으나, 제안 모델은 소형 객체에 대한 정확도가 전반적으로 향상된 것을 확인할 수 있었다.

야간 환경에서는 조도 감소로 인해 전체적인 영상 대비가 낮아짐에 따라 Baseline과 제안 모델이 모두 저 대비 상황에 놓인 신호등에 대한 정확성이 떨어지는 경향을 보였다. 일부 객체가 검출되지 않거나 Confidence가 낮아지는 사례가 관찰되었으나, 제안 모델이 Traffic sign에 대해 향상된 정확성을 보였다.

종합적으로 제안 모델은 다양한 주행 환경에서 Baseline 대비 소형 객체에 대한 검출 누락이 감소하고, 복수의 소형 객체를 동시에 검출하는 능력이 향상된 것을 확인할 수 있었다. 중·대형 객체에 대해서는 Baseline 대비 소폭 낮은 정확성을 보였다.

Fig. 20은 실제 주행 환경에서 제안 모델이 검출에 실패한 사례를 나타낸다. 좌측 장면은 가드레일에 의해 차량 객체가 부분적으로 가려진 상황으로, 객체의 외형 정보가 크게 감소한 경우이다. 이러한 환경에서는 객체의 형태적 특징이 제한적으로 나타나기 때문에 검출이 어려우며, 제안 모델 또한 해당 차량을 검출하지 못하였다. 이는 소형 객체에 대한 특징 표현을 강화하는 과정에서 부분 가림 상황에서 필요한 전역적인 형태 정보의 활용이 제한될 수 있음을 보여준다.

Fig. 20

Failure cases in real-world driving scenarios

우측 장면은 강한 역광으로 인해 렌즈 플레어가 발생하고 신호등 주변에 광학적 노이즈가 형성된 환경이다. 이로 인해 실제 객체와 배경 간의 대비가 감소하고 신호등의 색상 및 형상 정보가 왜곡되어 상단 신호등에 대한 검출이 이루어지지 않았다. 이러한 결과는 조명 변화가 큰 환경에서의 특징 표현 안정성에 추가적인 개선이 필요함을 시사한다.

이와 같은 실패 사례는 실제 주행 환경에서 발생할 수 있는 다양한 환경 조건에 대해 제안 모델이 여전히 해결해야 할 과제가 존재함을 보여주며, 향후 부분 가림 상황과 강한 조도 변화에 강인한 특징 추출 구조에 대한 추가적인 연구가 필요함을 의미한다.


6. 결 론

본 연구에서는 YOLOv10 기반 객체 탐지 모델에 LFA와 REMBC 구조를 적용하고, Jetson Orin Nano 기반 임베디드 환경에서 실제 차량 탑재 카메라로부터 입력되는 실시간 영상을 이용하여 성능을 실증하였다. 이는 공개 데이터셋 기반 성능 비교에 국한되지 않고 주행 환경에서의 탐지 안정성과 실시간 동작 가능성을 동시에 검증했다는 점에서 의의가 있다. 실험 결과 제안 모델은 실차 환경에서 소형 객체에 대한 탐지 성능이 향상되었으며, 약 25 FPS 수준의 처리 속도를 유지하여 임베디드 환경에서 요구되는 실시간성을 확보하였다. 이러한 결과는 제한된 연산 자원 환경에서도 중요 공간 영역에 연산을 집중하는 구조를 통해 소형 객체의 특징 표현을 효과적으로 강화할 수 있음을 보여준다.

벤치마크 데이터셋 실험에서는 소형 객체에 대한 성능 향상이 확인된 반면 전체 mAP는 소폭 감소하는 경향이 나타났다. 이는 LFA가 중요한 공간 영역에 연산을 집중하는 선택적 특징 표현 방식을 사용함에 따라, 제한된 Feature 표현 용량이 소형 객체에 우선적으로 할당되었기 때문으로 해석된다. 즉, 전역적인 형태 정보에 대한 표현력은 일부 감소할 수 있으나 영상 내 점유 비율이 작은 객체에 대한 표현력은 향상되는 특성을 보인다. 그러나 실차 환경 정량 평가에서도 소형 객체에 대한 AP가 향상된 결과가 확인되었으며, 자율주행 인지 시스템에서 신호등, 교통 표지와 같은 소형 객체는 주행 의사결정에 직접적인 영향을 미치는 핵심 요소라는 점을 고려하면 이러한 특성은 Task 관점에서 타당한 Trade-off로 볼 수 있다. 따라서 본 연구의 결과는 일반적인 객체 탐지 성능의 절대적인 향상보다는 실제 자율주행 환경에서 요구되는 객체에 대한 인지 성능을 우선적으로 개선하는 방향의 Task-oriented 성능 향상으로 해석할 수 있다. 임베디드 환경에서의 적용 측면에서 보면, 제안 모델은 소형 객체 탐지 성능 향상에도 불구하고 실시간 처리가 가능한 수준의 추론 속도를 유지하였다. 이는 Multi-Branch 구조를 재파라미터화해 단일 경로로 변환함으로써 추론 시 연산량 증가를 억제하고, 선택적 Attention 구조를 통해 불필요한 공간 연산을 줄였기 때문이다. 이러한 결과는 정확도 향상과 실시간성 확보 사이에서의 균형점을 실제 하드웨어 환경에서 확인했다는 점에서 의미가 있다.

정성적 평가에서는 다양한 주행 환경에서 제안 모델이 원거리 소형 객체를 보다 안정적으로 검출하는 경향을 보였다. 특히 도심 교차로와 곡선 구간에서 복수의 소형 객체를 동시에 검출하는 능력이 향상된 것을 확인할 수 있었다. 이는 중요 공간 영역에 집중하는 특징 표현 방식이 배경 정보에 의한 간섭을 줄이고 객체의 핵심 특징을 유지하는 데 효과적으로 작용했기 때문으로 판단된다. 반면 가드레일에 의해 객체가 부분적으로 가려진 상황이나 강한 역광으로 인해 렌즈 플레어가 발생한 환경에서는 일부 객체에 대한 검출이 이루어지지 않는 사례가 확인되었다. 이러한 결과는 선택적 특징 강화 구조가 전역적인 형태 정보가 크게 손실되는 상황이나 조명 변화가 급격한 환경에서는 여전히 한계를 가질 수 있음을 보여준다.

본 연구는 실제 주행 환경에서 수집된 데이터를 기반으로 성능을 검증하였으나, 실험 환경이 특정 테스트베드 구간에 한정되어 있으며 검출 객체의 종류 또한 제한적이라는 한계를 가진다. 또한 LFA와 Multi-Branch 구조의 결합이 Backbone 및 Head 영역까지 확장된 형태에 대한 최적화는 이루어지지 않았다. 향후 다양한 주행 환경과 객체 범주에 대한 검증을 통해 모델의 일반화 성능을 추가적으로 분석할 필요가 있으며, 부분 가림 상황과 강한 조도 변화에 대해 강인한 특징 표현이 가능하도록 전역 형태 정보를 보완하는 구조에 대한 연구가 필요하다.

종합적으로 본 연구는 임베디드 기반 자율주행 환경에서 소형 객체 인지 성능 향상과 실시간 처리 가능성 사이의 균형점을 실제 차량 실증을 통해 확인하였다는 점에서의미가 있으며, 제안된 구조는 향후 실차 기반 자율주행 인지 시스템에 적용 가능한 경량 객체 탐지 모델 설계의 방향성을 제시한다.

Nomenclature

F_att : attention-enhanced feature map
F_out : output feature map
F_e : input feature map
Q : query matrix
K : key matrix
V : value matrix
Q_masked : masked query matrix
K_masked : masked key matrix
M : importance mask
d : dimension of query and key
α_i : normalized attention coefficient
s_i : attention score
B_i(·) : i-th branch function
n : number of branches
x : input feature map to convolution
y : output feature map of convolution
W_rep : convolution weight
b_rep : convolution bias
(·)^T : matrix transpose
: element-wise multiplication
|| : concatenation operator
Subscripts
att : attention-related feature
out : output feature
e : input feature
i, j : branch or element index
masked : masked representation
rep : representation layer

Acknowledgments

본 과제(결과물)는 2025년도 교육부 및 충청북도의 재원으로 충북RISE센터의 지원을 받아 수행된 지역혁신중심 대학지원체계(RISE)의 결과입니다(2025-RISE-11-014-03).

이 연구는 2025년도 산업통상자원부 및 한국산업기술기획평가원(KEIT) 연구비 지원에 의한 결과임(RS-2025-25454779).

References

  • E. J. Bong, Y. H. Choi, G. R. Ahn and S. C. Kee, “Camera-LiDAR Sensor Fusion Cognitive Algorithm for High-Speed Autonomous Racing,” Transactions of KSAE, Vol. 33, No. 4, pp.303-312, 2025. [https://doi.org/10.7467/KSAE.2025.33.4.303]
  • Y. J. Ban, H. J. Kim, E. J. Bong, G. R. Ahn and S. C. Kee, “Obstacle Avoidance Path Planning and Tracking Algorithm for Autonomous Vehicle Racing,” Transactions of KSAE, Vol.33, No.6, pp.407-417, 2025. [https://doi.org/10.7467/KSAE.2025.33.6.407]
  • H. Wang, Y. Zheng, J. Huang, H. Tang, M. Zhou, H. Huang and R. He, “RT-DETR: Real-Time Detection Transformer,” arXiv preprint arXiv:2304.08069, , 2023.
  • P. Viola and M. Jones, “Rapid Object Detection using a Boosted Cascade of Simple Features,” Proceedings of the 2001 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, pp.I-1-I-8, 2001. [https://doi.org/10.1109/CVPR.2001.990517]
  • N. Dalal and B. Triggs, “Histograms of Oriented Gradients for Human Detection,” IEEE Conference on Computer Vision and Pattern Recognition, Vol. 1, pp.886-893, 2005. [https://doi.org/10.1109/CVPR.2005.177]
  • D. G. Lowe, “Distinctive Image Features From Scale-Invariant Keypoints,” International Journal of Computer Vision, Vol. 60, No. 2, pp.91-110, 2004. [https://doi.org/10.1023/B:VISI.0000029664.99615.94]
  • A. Krizhevsky, I. Sutskever and G. E. Hinton, “ImageNet Classification With Deep Convolutional Neural Networks,” Advances in Neural Information Processing Systems, Vol. 25, pp.1097-1105, 2012.
  • W. Liu, D. Anguelov, D. Erhan, C. Szegedy, S. Reed, C.-Y. Fu and A. C. Berg, “SSD: Single Shot MultiBox Detector,” European Conference on Computer Vision, pp.21-37, 2016. [https://doi.org/10.1007/978-3-319-46448-0_2]
  • R. Girshick, “Fast R-CNN,” International Conference on Computer Vision (ICCV), pp.1440-1448, 2015. [https://doi.org/10.1109/ICCV.2015.169]
  • S. Ren, K. He, R. Girshick and J. Sun, “Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks,” IEEE Transactions on Pattern Analysis and Machine Intelligence, Vol. 39, pp.1137-1149, 2017. [https://doi.org/10.1109/TPAMI.2016.2577031]
  • J. Redmon, S. Divvala, R. Girshick and A. Farhadi, “You Only Look Once: Unified, Real-Time Object Detection,” IEEE Conference on Computer Vision and Pattern Recognition, pp.779-788, 2016. [https://doi.org/10.1109/CVPR.2016.91]
  • Ultralytics, YOLOv10 Documentation, https://docs.ultralytics.com/ko/models/yolov10/, , 2024.
  • S. Han, J. Pool, J. Tran and W. Dally, “Learning Both Weights and Connections for Efficient Neural Networks,” Advances in Neural Information Processing Systems, Vol. 28, pp.1135-1143, 2015.
  • B. Jacob, S. Kligys, B. Chen, M. Zhu, M. Tang, A. G. Howard, H. Adam and D. Kalenichenko, “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference,” IEEE Conference on Computer Vision and Pattern Recognition, pp.2704-2713, 2018. [https://doi.org/10.1109/CVPR.2018.00286]
  • A. G. Howard, M. Zhu, B. Chen, D. Kalenichenko, W. Wang, T. Weyand, M. Andreetto and H. Adam, “MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications,” arXiv preprint arXiv:1704.04861, , 2017.
  • X. Zhang, x. Zhou, M. Lin and J. Sun, “ShuffleNet: An Extremely Efficient Convolutional Neural Network for Mobile Devices,” IEEE Conference on Computer Vision and Pattern Recognition, pp.6848-6856, 2018. [https://doi.org/10.1109/CVPR.2018.00716]
  • T. Y. Lin, P. Goyal, R. Girshick, K. He and P. Dollár, “Feature Pyramid Networks for Object Detection,” IEEE Conference on Computer Vision and Pattern Recognition, pp.2117-2125, 2017.
  • S. Liu, L. Sheng, J. Shao and J. Yan, “Path Aggregation Network for Instance Segmentation,” IEEE Conference on Computer Vision and Pattern Recognition, pp.8759-8768, 2018. [https://doi.org/10.1109/CVPR.2018.00913]
  • M. Tan, R. Pang and Q. V. Le, “EfficientDet: Scalable and Efficient Object Detection,” IEEE Conference on Computer Vision and Pattern Recognition, pp.10781-10790, 2020. [https://doi.org/10.1109/CVPR42600.2020.01079]
  • G. R. Ahn and S. C. Kee, “LiteFocusAttention: A Lightweight Attention Module for Autonomous Driving Mobility,” KSAE Annual Conference Proceedings, pp.747-748, 2025.
  • T. Y. Lin, M. Maire, S. Belongie, L. Bourdev, R. Girshick, J. Hays, P. Perona, D. Ramanan, C. L. Zitnick and P. Dollár, “Microsoft COCO: Common Objects in Context,” European Conference on Computer Vision, pp.740-755, 2014. [https://doi.org/10.1007/978-3-319-10602-1_48]
  • F. Yu, H. Chen, X. Wang, W. Xian, Y. Chen, F. Liu, V. Vanhoucke and T. Karypis, “BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask Learning,” IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp.2633-2642, 2020. [https://doi.org/10.1109/CVPR42600.2020.00271]
  • Rideflux, Rideflux Homepage, https://www.rideflux.com/, , 2026.

Fig. 1

Fig. 1
Conceptual diagram of autonomous driving decision making

Fig. 2

Fig. 2
Comparison of COCO mAP and latency of object detection models

Fig. 3

Fig. 3
Example of HOG and SIFT-based feature extraction results

Fig. 4

Fig. 4
Architecture of Yolov10

Fig. 5

Fig. 5
Concept of computation in Depthwise convolution

Fig. 6

Fig. 6
Architectures of FPN, PANet, and BiFPN

Fig. 7

Fig. 7
Proposed model overall architecture

Fig. 8

Fig. 8
Architecture of LFA

Fig. 9

Fig. 9
Architecture of AIM

Fig. 10

Fig. 10
Architecture of MBC

Fig. 11

Fig. 11
Architecture of REMBC

Fig. 12

Fig. 12
Experimental vehicle used for real-world validation (left: overall view of the vehicle, right: sensor-mounted configuration)

Fig. 13

Fig. 13
Dataset sample images

Fig. 14

Fig. 14
Empirical test FPS measurement results

Fig. 15

Fig. 15
Empirical detection results

Fig. 16

Fig. 16
Benchmark dataset inference results (upper: BDD100K, lower: COCO 2017)

Fig. 17

Fig. 17
BDD100K small object example

Fig. 18

Fig. 18
Small, medium, and large object detection results

Fig. 19

Fig. 19
Qualitative comparison of object detection results in real-world driving environmentLeft: YOLOv10s (Baseline), Right: Ours Model

Fig. 20

Fig. 20
Failure cases in real-world driving scenarios

Table 1

Ground Truth components

Object type Characteristic
Car Medium and large objects
Person Small and medium objects
Traffic sign Small and medium objects
Traffic light Small and medium objects

Table 2

Ground Truth dataset statistics

Scenario Time Weather Frames Total
Urban Day Clear 1,261 6,236
Frames
After snowfall 536
Night Clear 827
After snowfall 511
Outer circuit Day Clear 1,179
After snowfall 570
Night Clear 824
After snowfall 528

Table 3

Configuring empirical scenario

Scenario Driving time Situation
S1 ≥ 30 min Driving on the urban
S2 ≥ 1 hour Driving on the outer circuit

Table 4

Benchmark DB configuration

Dataset Classes Train images Val images
COCO2017 80 118,000 5,000
BDD100K 10 80,000 20,000

Table 5

Benchmark comparison model configuration

Models LFA AIM MBC REMBC
YOLOv10s        
V1 O      
V2 O O    
V3 O O O  
V4 O O O O

Table 6

Empirical experiment results (average FPS)

Scenario S1 S2
Model YOLOv10s Ours YOLOv10s Ours
Average FPS 23.43 25.03 23.24 24.92
FPS trend line slope -0.0064 -0.011 -0.0132 -0.0115

Table 7

Benchmark ablation study results (COCO2017)

Model Params mAP E2E_Time
v10s 8.06 M 0.459 42.01
v1 7.74 M 0.456 41.38
v2 7.78 M 0.458 41.41
v3 6.52 M 0.453 40.42
v4 6.52 M 0.452 39.28

Table 8

Benchmark ablation study results (BDD100K)

Model Params mAP E2E_Time
v10s 8.06 M 0.511 42.03
v1 7.74 M 0.507 41.42
v2 7.78 M 0.509 41.44
v3 6.52 M 0.502 40.42
v4 6.52 M 0.500 39.30

Table 9

Small object detection results (BDD100K)

  Small objects Medium objects Large objects
v10s Ours v10s Ours v10s Ours
Car 0.390 0.419 0.525 0.505 0.572 0.545
Person 0.374 0.402 0.501 0.485 0.552 0.525
Traffic sign 0.321 0.390 0.499 0.492 0.547 0.529
Average 0.382 0.411 0.516 0.501 0.564 0.539

Table 10

Quantitative evaluation results by object size in realworld environment

  Small objects Medium objects Large objects
v10s Ours v10s Ours v10s Ours
AP@50 0.349 0.361 0.476 0.464 0.565 0.553
Precision 0.521 0.542 0.628 0.614 0.664 0.655
Recall 0.312 0.325 0.437 0.424 0.518 0.512