• 대한전기학회
Mobile QR Code QR CODE : The Transactions of the Korean Institute of Electrical Engineers
  • COPE
  • kcse
  • 한국과학기술단체총연합회
  • 한국학술지인용색인
  • Scopus
  • crossref
  • orcid

  1. 강원대학교 데이터사이언스학과 (Dept. of Data Science, Kangwon National University, Korea. E-mail : kjh333@kangwon.ac.kr)



Deep Learning, EfficientNetV2, Sow Farrowing Status Classification, ROI-based Activation Regularization (RAR), Localization by Classification (LbC)

1. 서 론

1.1 연구 배경

국가데이터처가 2026년에 발표한 2025년 4분기 가축동향조사 보도자료에 따르면, 국내 돼지 사육 농가 수는 2021년 5,942호에서 2025년 5,383호로 감소하였다. 사육 마릿수 또한 2021년 약 11,217,000두에서 2025년 약 10,792,000두까지 지속적으로 감소하고 있다[1]. 그림 1은 2021년부터 2025년까지 국내 돼지 사육 농가 수와 사육 마릿수의 연도별 추이를 나타낸다. 이는 국내 양돈 산업의 생산 기반이 축소되고 있음을 시사하며, 제한된 생산 기반에서 사육 손실을 줄이기 위한 효율적 관리 체계 구축의 필요성을 높인다[2]. 양돈 생산 과정에서 분만은 생산 성과에 직접적인 영향을 미치는 핵심적인 요소이다[3]. 분만 전후는 관리 요구가 집중되는 시기이며, 분만 직후 자돈은 체온 유지에 취약하고 모돈의 자세 변화로 인해 압사 위험이 증가한다[4] [5]. 따라서 분만 진행 여부를 신속하게 인지하여 집중 관리를 가능하게 하는 분만 탐지 기술이 요구된다[6]. 최근에는 이러한 문제를 해결하기 위한 방법으로 딥러닝을 기반으로 한 분만 식별 시스템이 주목받고 있다[7].

그림 1. 국내 돼지 사육 농가 수와 사육 마릿수의 연도별 추이 (단위: 농가 수는 호, 사육 마릿수는 천두)

Fig. 1. Annual Trends in the Number of Pig Farms and Pigs Raised in Korea (pig population in thousand heads)

../../Resources/kiee/KIEE.2026.75.8.1929/fig1.png

1.2 관련 연구

먼저, 분만 직후 자돈의 끼임 및 압사와 같은 고위험 상황을 직접 탐지하는 연구가 수행되었다[8]. 해당 연구에서는 분만사 영상에서 no trapping, trapping, crushing의 세 가지 클래스를 정의하고 YOLO 계열 모델을 비교하여 trapping 클래스 기준 AP(Average Precision)가 0.963임을 보고하였다. 분만 전후 상태를 더 정밀하게 추적하기 위해 포즈 추정 기반 접근도 제안되었다[9]. 해당 연구는 영상에서 모돈 및 자돈의 주요 신체 부위를 추정하여 자세 및 행동의 변화를 정량화하는 방식을 활용하였으며 DeepLabCut 기반에서 다수 네트워크(ResNet50, ResNet101, MobileNet, EfficientNet, DLCRNet)를 비교하였다. 그 결과 MobileNet 기반 모델에서 모돈 신체 부위 추정의 중앙값 테스트 오차가 0.61 픽셀로 나타났으며 분만 전후의 상태 변화를 좌표 시계열로 확보할 수 있는 기반을 마련하였다. 분만 탐지를 단일 판단으로 제한하지 않고 분만 개시 및 종료 시점 정의와 분만 소요 시간 산출까지 연결한 프레임워크도 제시되었다[10]. 해당 연구는 분만 개시를 첫 자돈 출현 시점으로, 종료를 태반 배출 탐지 시점으로 정의하였다. YOLOv8과 회전 바운딩 박스(Rotated Bounding Box)를 결합하여 mAP@50 기준 0.967을 달성하였다. 또한 분만 모니터링의 신뢰성 향상을 위해 신생 자돈 검출 성능을 강화하는 학습 전략도 보고되었으며 Noisy Student 기반 접근을 통해 검출 성능 개선을 제시하였다[11]. 한편, 분만사 환경에서의 비침습 모니터링 관점에서는 영상 기반 접근과 가속도 센서 기반 접근을 비교하여 영상 기반 모니터링의 활용 가능성을 논의한 연구도 보고되었다[12]. 이와 같이 영상 기반 돼지 분만 탐지의 기존 연구는 시각적 정보를 활용하여 분만과 연관된 상태를 자동으로 인지하는 방향으로 발전해 왔다. 그러나 기존 연구는 주로 객체 검출, 자세 추정, 또는 분만 이벤트 탐지에 초점을 두었으며, 이미지 단위 분만 진행 여부 분류에서 ROI 정보를 손실 함수에 직접 반영하는 학습 전략은 충분히 다루어지지 않았다. 이에 본 연구에서는 영상 기반 모돈 분만 여부 분류를 위해 학습 단계에서 ROI 기반 특징 정렬을 직접 유도하는 손실 설계인 RAR-LbC를 제안한다. 구체적으로 활성 분포가 ROI에 집중되도록 유도하는 RAR(ROI-based Activation Regularization)과 분류에 사용되는 공간 어텐션 분포의 ROI 정렬을 유도하는 LbC(Localization by Classification)를 결합하였다. 이를 통해 영상 기반 분만 분류에서 분류 성능 개선을 도모하고, 분만 모니터링 자동화를 위한 기술적 기반을 제공하고자 한다.

2. 본 론

본 연구는 분만과 비분만 분류 성능 향상을 위해 RAR과 LbC를 결합한 손실 함수 RAR-LbC를 제안한다. 본 절에서는 데이터셋 구성 및 전처리, 모델 구조, 학습 전략을 단계별로 제시한다.

2.1 데이터셋 구성

본 연구에서 사용한 모돈 분만 영상 데이터셋은 대한민국 경상남도 함안군 소재 양돈 농가의 분만사에서 수집하였다. 촬영은 모돈을 상부에서 내려다보는 top-view 환경에서 수행되었으며 2D 카메라를 바닥으로부터 약 2.3 m 높이에 고정 설치하여 영상을 획득하였다. 획득한 영상은 MP4 동영상 형식으로 저장한 뒤 초당 10 프레임을 균일 간격으로 샘플링하여 이미지 단위의 학습 데이터로 변환하였다. 연속 프레임 간 상관으로 인한 데이터 누수를 방지하기 위해 Train, Validation, Test 세트는 동일 모돈 또는 동일 분만 이벤트가 서로 다른 세트에 중복되지 않도록 분리하였다. 해당 작업을 거쳐 총 23,326장의 데이터셋을 구축하였으며 축산 전문가가 라벨링을 수행하여 분만 10,502장과 비분만 12,824장의 데이터를 확보하였다. 분만 클래스는 첫 자돈 출현 프레임부터 태반 배출이 확인된 프레임까지의 구간에서 추출한 프레임으로 정의하였으며 비분만 클래스는 그 외 구간에서 추출한 프레임으로 정의하였다. 따라서 본 연구의 분류 문제는 분만 전 예측이 아니라 영상 프레임에서의 분만 진행 여부 분류로 정의된다. 구성된 데이터는 각 클래스의 분포를 고려하여 Train, Validation, Test 세트로 약 6:2:2 비율로 분할하였다. 표 1은 본 연구에 사용된 데이터셋 구성을 나타내었으며 그림 2는 본 연구에 사용된 데이터셋의 분만 이미지 예시를 나타낸다.

표 1. 모돈 분만 여부 분류를 위한 이미지 데이터셋 구성

Table 1. Dataset Composition for Sow Farrowing Status Classification

Type Train Validation Test Total
Farrowing 6,314 1,903 2,285 10,502
Non-farrowing 7,811 2,632 2,381 12,824

그림 2. 모돈 분만 데이터셋의 분만 이미지 예시

Fig. 2. Example of a Farrowing Image from the Sow Farrowing Dataset

../../Resources/kiee/KIEE.2026.75.8.1929/fig2.png

2.2 EfficientNetV2

CNN(Convolutional Neural Network)은 컴퓨터 비전 분야에서 장기간 활용되어 온 대표적 구조로 지역적 수용영역과 가중치 공유에 기반하여 안정적인 특징 추출이 가능하다[13]. 본 연구에서는 프레임 샘플링으로 구축한 모돈 분만 이미지에서 시각 특징을 추출하기 위한 백본 네트워크로 EfficientNetV2를 사용하였다.

그림 3. EfficientNetV2 기반 분류 모델의 구조

Fig. 3. Schematic Architecture of the EfficientNetV2-based Classification Model

../../Resources/kiee/KIEE.2026.75.8.1929/fig3.png

EfficientNetV2는 EfficientNet 계열의 파라미터 효율을 유지하면서 학습 처리량과 학습 효율을 고려하여 블록 구성과 스케일링 전략을 재정립한 모델이다[14]. 구조적으로는 MBConv와 Fused-MBConv 블록의 조합을 핵심으로 하며 초기 단계에는 연산 경로를 단순화한 Fused-MBConv를 배치하고 이후 단계에서는 채널 확장, depthwise convolution, 채널 축소의 흐름을 갖는 MBConv를 중심으로 심층 표현을 학습한다. 이러한 구성은 초기 단계의 처리 효율을 고려하면서도 후반 단계에서 충분한 특징 표현력을 확보하도록 설계된 것으로 정리할 수 있다. 또한 stage별 용량 배분을 균등 확장에 고정하지 않고 후반 표현 학습 구간에 상대적으로 더 많은 깊이를 배치하는 방식이 함께 사용되며 이는 동일한 연산 예산에서 표현 용량을 효율적으로 배분하기 위한 설계 방향에 해당한다. 학습 측면에서 EfficientNetV2는 progressive learning을 제안하며 학습 과정에서 입력 해상도를 점진적으로 증가시키는 동시에 데이터 증강 및 정규화 강도를 함께 조절하는 전략을 포함한다. 본 연구에서는 ImageNet으로 사전학습된 EfficientNetV2-M를 백본으로 사용하고, 입력 이미지를 224×224로 리사이즈한 뒤 특징 표현을 추출하여 분만과 비분만을 분류하도록 모델을 구성하였다. 그림 3은 EfficientNetV2의 세부 구조 시각화를 나타낸다.

2.3 RAR(ROI-based Activation Regularization)

RAR은 백본 특징이 영상 전역으로 분산되는 현상을 완화하고 유효 관측 영역인 ROI(Region of Interest)에 특징 활성도가 집중되도록 유도하기 위한 정규화 항이다. 먼저 입력 이미지 $x$를 백본 네트워크에 입력하여 특징 표현을 추출하고 이를 특징맵 $F$로 변환한다. 이후 다양한 백본 출력 형태를 동일한 해상도로 맞추기 위해 adaptive average pooling을 적용하여 특징맵의 크기를 $H \times W$로 통일한다. 본 연구에서 ROI 마스크는 $H = W = 7$ 격자에서 (행과 열 인덱스는 1부터 시작한다고 가정할 때) 행 3–7, 열 2–6으로 사전 정의하였다. 해당 ROI는 본 연구의 분만사 촬영 환경에서 모돈의 둔부 및 분만 관련 시각 단서가 영상의 중앙 하단 영역에 주로 위치하는 경향을 반영하여 설정하였다. 또한 ROI는 라벨 정보 또는 테스트 세트 성능에 기반한 사후 조정 없이 데이터 수집 환경과 분만 관련 영역의 공간적 분포를 고려하여 사전에 정의한 고정 마스크이다. 따라서 본 연구에서는 ROI를 성능 최적화 대상이 아닌 사전 정의된 공간 제약으로 사용하였다. 여기서 ROI 마스크 M은 ROI 내부에서 1, ROI 외부에서 0의 값을 갖는다. 다음으로 특징맵을 채널 방향으로 평균하여 활성맵 $A$를 구성한다. 이는 각 위치에서의 평균 활성도를 나타내며 이에 대한 수식은 식 (1)과 같다.

(1)
$F \in R^{B \times C \times H \times W} \\ A = mean_c(F) \in R^{B \times 1 \times H \times W}$

활성맵을 확률 분포로 해석하기 위해 각 샘플별 공간 위치 전체에 대해 softmax 정규화를 적용하고 정규화된 활성 분포 $P$를 정의한다. 활성 분포 $P$는 모든 위치에서 0 이상의 값을 가지며 전체 합이 1이 되도록 정규화된다. 이에 대한 수식은 식 (2)와 같다.

(2)
$P_{i,j} = \frac{\exp(A_{i,j})}{\sum_{m=1}^{H}\sum_{n=1}^{W}\exp(A_{m,n})}, \sum_{i=1}^{H}\sum_{j=1}^{W}P_{i,j} = 1$

이후 ROI 마스크 $M$을 활용하여 ROI 외부에 할당된 활성 분포 질량에 벌점을 부여하는 RAR 손실을 정의한다. RAR 손실은 ROI 외부 확률 질량의 합을 최소화하도록 구성되며 학습 과정에서는 미니배치 평균으로 계산한다. 이에 대한 수식은 식 (3)과 같다.

(3)
$L_{RAR} = E\left[\sum_{i=1}^{H}\sum_{j=1}^{W}(1-M_{i,j})P_{i,j}\right]$

(3)는 ROI 외부에 할당된 확률 질량의 합을 최소화하도록 구성되어 있으며 결과적으로 활성 분포가 ROI 내부로 더 많이 배분되도록 유도한다.

2.4 LbC(Localization by Classification)

LbC는 분류 결정에 직접 사용되는 어텐션을 ROI에 정렬시키기 위한 구성이다. 먼저 2.3절에서 정의한 크기 $H \times W$로 정의된 특징맵 $F$를 입력으로 사용하고 $F$로부터 위치별 중요도를 나타내는 점수맵 $S$를 생성한다. 이는 $1 \times 1$ 합성곱을 통해 채널 정보를 위치별 스칼라 점수로 변환하는 과정이며 이에 대한 수식은 식 (4)와 같다.

(4)
$S = Conv_{1\times1}(F) \in R^{B \times 1 \times H \times W}$

다음으로 점수맵에 softmax 정규화를 적용하여 어텐션 분포 $a$를 정의한다. 이때 softmax는 각 샘플에 대해 $H \times W$ 공간 차원 전체에 적용한다. 어텐션 분포 $a$는 전체 합이 1이 되도록 정규화되며 이에 대한 수식은 식 (5)와 같다.

(5)
$a_{i,j} = \frac{\exp(S_{i,j})}{\sum_{m=1}^{H}\sum_{n=1}^{W}\exp(S_{m,n})}, \sum_{i=1}^{H}\sum_{j=1}^{W}a_{i,j} = 1$

이후 어텐션 분포 $a$를 가중치로 사용하여 특징맵을 가중 합으로 집계하고 분류에 사용되는 특징 벡터 $z$를 구성한다. 이에 대한 수식은 식 (6)과 같다. 최종 분류 점수 벡터 $s$은 선형 분류기를 통해 계산되며 이에 대한 수식은 식 (7)과 같다.

(6)
$z_b = \sum_{i=1}^{H}\sum_{j=1}^{W}a_{b,i,j}F_{b,:,i,j}, z_b \in R^C$
(7)
$s = W_c z + b_c$

여기서 $W_c$는 선형 분류기의 가중치 행렬, $b_c$는 선형 분류기의 편향 벡터를 의미한다. 최종 분류 점수 벡터 $s$는 분만과 비분만 분류를 위한 최종 로짓으로 교차 엔트로피 손실 계산에 사용된다. LbC 손실은 $s$에 직접 작용하지 않고 $s$를 생성하는 특징 어텐션 분포를 ROI에 정렬시키도록 정규화한다. 이를 위해 ROI 마스크 $M$을 이용하여 ROI 내부에서는 어텐션 분포가 증가하고 외부에서는 감소하도록 하는 정규화 항을 정의한다. LbC 손실은 미니배치 평균으로 계산되며 이에 대한 수식은 식 (8)과 같다.

(8)
$L_{LbC} = E\left[\sum_{i=1}^{H}\sum_{j=1}^{W}M_{i,j}(1-a_{i,j}) + a_{i,j}(1-M_{i,j})\right]$

(8)은 학습이 진행될수록 분류에 사용되는 특징 집계가 ROI 중심으로 이루어지고 분만 분류에 유효한 시각적 단서가 분류 결정에 직접 반영되도록 구성된다.

2.5 RAR-LbC

최종적으로 본 연구의 손실 함수는 분류를 위한 교차 엔트로피 손실 $L_{CE}$에 RAR 손실 $L_{RAR}$과 LbC 손실 $L_{LbC}$를 가중합으로 결합하여 구성한다. RAR 손실은 특징맵으로부터 계산된 활성 분포가 ROI 외부로의 확산을 억제하며 분만 분류에 유효한 특징 활성도가 ROI 내부에 집중되도록 학습을 유도한다. LbC 손실은 분류 과정에서 특징을 집계할 때 사용되는 어텐션 가중치가 ROI 내부에서 증가하고 ROI 외부에서 감소하도록 정규화하여 분류 결정이 ROI 중심 정보에 기반하도록 유도한다. 따라서 RAR은 특징 활성의 분포를 ROI에 정렬하고 LbC는 분류에 직접 사용되는 집계 가중치의 분포를 ROI에 정렬함으로써 상호보완적으로 동작한다. 이에 대한 수식은 식 (9)와 같다.

(9)
$L_{total} = L_{CE} + \alpha L_{RAR} + \beta L_{LbC}$

(9)에서 $\alpha$와 $\beta$는 각각 RAR 손실과 LbC 손실의 기여도를 조절하는 가중 계수이며 본 연구에서는 두 정규화 항을 동일하게 반영하는 기준 설정으로 $\alpha = 0.5$, $\beta = 0.5$를 사용하였다. 따라서 최종 손실 함수는 분류 성능을 직접적으로 최적화하는 $L_{CE}$와 함께 특징 활성 분포 ROI 정렬 및 분류에 사용되는 어텐션 분포의 ROI 정렬이 동시에 반영되도록 구성한다.

3. 연구 결과

본 연구는 분만 분류 성능을 정량적으로 평가하기 위해 혼동 행렬 기반의 분류 지표를 활용하였다. 혼동 행렬은 예측 결과와 실제 레이블의 조합으로부터 정답 및 오분류의 발생 양상을 구조적으로 제시하며 이를 바탕으로 Recall, Accuracy, F1-score, AUC(Area Under the ROC Curve)를 평가지표로 사용하였다. 본 연구에서는 분만 클래스를 양성 클래스로 설정하였다. Recall은 실제 분만인 프레임 이미지 중에서 모델이 분만으로 정확히 분류한 비율을 의미하며 분만 프레임 이미지를 분만으로 올바르게 판별하는 정도를 나타낸다. Accuracy는 전체 영상 중에서 모델의 예측이 정답과 일치한 비율을 의미하며 분만과 비분만을 포함한 전체 분류 성능을 나타낸다. Precision은 모델이 분만으로 예측한 프레임 이미지 중 실제 분만인 프레임 이미지의 비율을 의미한다. F1-score는 Precision과 Recall의 조화평균을 의미하며 모델이 분만으로 예측한 영상이 실제로 분만인 정도와 실제 분만 영상을 분만으로 맞춘 정도를 함께 고려한 지표이다. AUC는 ROC(Receiver Operating Characteristic) 곡선의 면적으로 정의된다. ROC는 분만으로 분류하기 위한 임계값을 변화시킬 때 참양성률과 거짓양성률의 관계를 나타낸 곡선이다. 따라서 AUC는 특정 임계값 선택에 의존하지 않고 분만과 비분만을 구분하는 전반적인 판별 성능을 정량화한 지표이다. 학습 시 배치 크기는 32로 설정하였으며 optimizer는 AdamW를 사용하였다[15]. 학습률, weight decay, 최대 epoch 수, 입력 해상도, 데이터 증강 방법, 사용한 GPU 환경은 각각 0.0001, 0.01, 100, 224×224, 온라인 데이터 증강, NVIDIA TITAN Xp (12GB)으로 설정하였다. 신뢰성을 확보하기 위해 원천 데이터셋을 모돈 또는 분만 이벤트 단위로 분리하여 동일 개체가 서로 다른 세트에 중복되지 않도록 한 뒤, 서로 다른 세 가지 Train, Validation, Test 분할을 구성하였다. 각 분할에 대해 서로 다른 시드를 세 번 적용하여 반복 실험을 수행하였다. 최종 성능은 반복 실험에서 산출된 각 평가지표의 평균으로 제시하였다. 과적합을 방지하기 위해 Early stopping을 적용하였다. Validation loss가 기존 최저값 대비 1% 이상 감소할 때를 개선으로 정의하였으며 이러한 개선이 10 epoch 연속 발생하지 않으면 학습을 조기 종료하였다. ROI Crop 조건은 원본 영상에서 ROI 영역만을 절단한 뒤, 백본 입력 해상도에 맞게 리사이즈하여 학습하는 방식으로 구성하였다. ROI Feature Pooling 조건은 원본 영상을 그대로 백본 네트워크에 입력하여 최종 특징맵 $F$를 생성한 뒤 사전 정의된 ROI 마스크에 해당하는 특징 영역만을 선택하여 평균 pooling하고 이를 분류기에 연결하는 방식으로 구성하였다. 해당 조건에서는 RAR 및 LbC 손실을 적용하지 않고 교차 엔트로피 손실만을 사용하여 학습하였다.

표 2. RAR-LbC를 적용한 분만 분류 성능 비교 (9회 반복 실험 평균 ± 표준편차, 단위: %)

Table 2. Comparison of Farrowing Classification Performance with RAR-LbC (mean and standard deviation over 9 runs) (unit: %)

Method Recall Accuracy F1-score AUC
Original 72.58 ± 2.12 78.93 ± 1.28 76.57 ± 1.94 84.97 ± 1.76
ROI Crop 72.20 ± 6.01 79.70 ± 1.57 77.08 ± 3.20 84.67 ± 2.34
ROI Feature Pooling 71.25 ± 1.02 80.78 ± 0.62 77.81 ± 1.11 88.39 ± 1.07
RAR-LbC 74.42 ± 2.45 80.32 ± 1.46 78.23 ± 1.63 87.88 ± 1.61

표 2는 원본 영상만 사용한 경우와 ROI를 Crop하여 학습한 경우, 전체 이미지를 입력으로 유지한 상태에서 특징맵의 ROI 영역만을 분류기에 연결한 ROI Feature Pooling을 적용한 경우 그리고 제안된 RAR-LbC를 적용한 경우의 분만 분류 성능 비교 결과를 나타낸다. ROI Crop을 적용한 경우 원본 대비 Accuracy와 F1-score는 소폭 향상되었으나 Recall과 AUC는 감소하였다. 이는 입력을 ROI로 제한하는 과정에서 배경 영향은 일부 감소할 수 있으나 분류에 기여하는 단서가 ROI 내부에 충분히 포함되지 않거나 주변 문맥 정보가 함께 제거될 경우 분만 판별 민감도와 전반적 판별력이 저하될 수 있음을 시사한다. ROI Feature Pooling의 경우 Accuracy와 AUC는 우수한 성능을 보였지만 Recall은 71.25%로 비교 조건 중 가장 낮은 값을 보였다. 이는 특징 수준에서 ROI 영역 특징만을 직접 사용하는 방식이 전반적인 판별 성능에는 도움이 될 수 있으나 실제 분만 프레임을 탐지하는 민감도 측면에서는 한계가 있음을 나타낸다. 반면 RAR-LbC는 ROI Feature Pooling 대비 Recall이 3.17%p, F1-score가 0.42%p 높게 나타났다. RAR-LbC는 전체 특징 표현을 유지한 상태에서 RAR 및 LbC 손실을 통해 ROI 중심의 어텐션 정렬을 유도하기 때문에 분만 관련 ROI 정보를 강조하면서도 주변 문맥 정보를 완전히 배제하지 않아 실제 분만 프레임 탐지 민감도 향상에 기여한 것으로 판단된다. 특히 분만 여부 분류에서는 분만 프레임의 미탐지가 후속 관리 지연으로 이어질 수 있으므로 Recall 향상은 실제 적용 관점에서 중요한 의미를 가진다. RAR 및 LbC 손실 구성 요소의 독립적인 효과를 확인하기 위해 RAR만 적용한 경우, LbC만 적용한 경우, 그리고 RAR과 LbC를 함께 적용한 경우의 성능을 비교하였다. 표 3은 RAR 및 LbC 손실 구성에 따른 분만 여부 분류 성능 비교 결과를 나타낸다.

표 3. RAR 및 LbC 손실 구성에 따른 분만 여부 분류 성능 비교 (9회 반복 실험 평균 ± 표준편차, 단위: %)

Table 3. Comparison of Farrowing Classification Performance According to RAR and LbC Loss Components (mean and standard deviation over 9 runs, unit: %)

Method Recall Accuracy F1-score AUC
Original 72.58 ± 2.12 78.93 ± 1.28 76.57 ± 1.94 84.97 ± 1.76
RAR Only 74.35 ± 3.39 80.15 ± 1.33 78.07 ± 1.50 87.98 ± 3.01
LbC Only 73.42 ± 1.84 80.50 ± 1.25 78.15 ± 1.64 88.31 ± 0.85
RAR-LbC 74.42 ± 2.45 80.32 ± 1.46 78.23 ± 1.63 87.88 ± 1.61

RAR만 적용한 경우 Original 대비 Recall은 1.77%p, Accuracy는 1.22%p, F1-score는 1.50%p, AUC는 3.01%p 향상되었다. 이는 ROI 외부 활성도를 억제하고 ROI 내부 영역의 활성도를 상대적으로 강조하는 RAR 손실이 분만 관련 영역 중심의 특징 표현 학습에 기여함을 의미한다. LbC만 적용한 경우에도 Original 대비 Recall은 0.84%p, Accuracy는 1.57%p, F1-score는 1.58%p, AUC는 3.34%p 향상되었다. 특히 Accuracy와 AUC에서 각각 80.50%와 88.31%로 가장 높은 값을 보였으며 이는 분류에 직접 사용되는 어텐션 분포를 ROI와 정렬하도록 유도하는 LbC 손실이 전반적인 판별 성능 향상에 효과적임을 보여준다. RAR과 LbC를 함께 적용한 RAR-LbC는 Recall 74.42%로 손실 구성 비교 조건 중 가장 높은 값을 보였다. 이는 단일 손실 항만 적용한 경우보다 RAR과 LbC를 함께 적용했을 때 실제 분만 프레임을 분만으로 올바르게 탐지하는 능력이 향상되었음을 의미한다. RAR-LbC는 F1-score에서도 78.23%로 손실 구성 비교 조건 중 가장 높은 값을 보여, 단순히 Recall만 증가한 것이 아니라 Precision과 Recall 간의 균형 측면에서도 가장 안정적인 결과를 나타냈다.

표 4. RAR 및 LbC 손실 가중치 변화에 따른 분만 여부 분류 성능 비교 (9회 반복 실험 평균 ± 표준편차, 단위: %)

Table 4. Comparison of Farrowing Classification Performance According to RAR and LbC Loss Weights (mean and standard deviation over 9 runs, unit: %)

α β Recall Accuracy F1-score AUC
0.1 0.9 72.90 ± 1.40 79.94 ± 1.01 77.69 ± 1.86 87.65 ± 0.81
0.9 0.1 72.77 ± 3.52 80.08 ± 1.62 77.58 ± 2.60 87.44 ± 1.26
0.5 0.5 74.42 ± 2.45 80.32 ± 1.46 78.23 ± 1.63 87.88 ± 1.61

RAR 및 LbC 손실 가중치 설정에 따른 성능 변화를 확인하기 위해 α와 β의 비율을 변경하여 추가 실험을 수행하였다. 표 4는 RAR 및 LbC 손실 가중치 변화에 따른 분만 여부 분류 성능 비교 결과를 나타낸다. α = 0.1, β = 0.9로 LbC 손실의 비중을 높인 경우 Recall은 72.90%, Accuracy는 79.94%, F1-score는 77.69%, AUC는 87.65%로 나타났으며 α = 0.9, β = 0.1로 RAR 손실의 비중을 높인 경우 Recall은 72.77%, Accuracy는 80.08%, F1-score는 77.58%, AUC는 87.44%로 나타났다. 반면 α = β = 0.5로 RAR과 LbC를 균형 있게 반영한 경우 Recall은 74.42%, Accuracy는 80.32%, F1-score는 78.23%, AUC는 87.88%로 본 연구에서 비교한 세 가지 가중치 조합 중 모든 평가지표에서 가장 높은 성능을 보였다. 이는 RAR 또는 LbC 중 하나의 손실 항을 과도하게 강조하지 않고 ROI 외부 활성도 억제와 어텐션 분포 정렬을 균형 있게 함께 반영하는 것이 분만 프레임 탐지와 전체적인 분류 성능 향상에 더 효과적일 수 있음을 시사한다. 따라서 본 연구에서는 RAR과 LbC의 상호보완적 효과를 고려하여 α = β = 0.5를 최종 손실 가중치로 설정하였다.

표 5. 전체 테스트셋에 대한 ROI 내부 및 외부 활성도 분포 분석 결과(평균 ± 표준편차)

Table 5. Analysis of ROI and Non-ROI Activation Distributions on the Entire Test Set (mean ± standard deviation)

Method ROI Activation Mass Non-ROI Activation Mass
Original 0.7220 ± 0.0239 0.2780 ± 0.0239
ROI Crop 0.6071 ± 0.0028 0.3929 ± 0.0028
ROI Feature Pooling 0.4569 ± 0.0677 0.5431 ± 0.0677
RAR-LbC 0.9863 ± 0.0206 0.0137 ± 0.0206

전체 테스트셋 수준에서 제안한 RAR-LbC가 ROI 중심의 특징 활성도를 유도하는지 확인하기 위해 ROI 내부 및 외부 활성도 분포 분석을 추가로 수행하였다. 표 5는 각 비교 모델에 대해 ROI Activation Mass와 Non-ROI Activation Mass를 산출한 결과를 나타낸다. Original 모델은 ROI Activation Mass가 0.7220으로 나타나 ROI 영역에 일정 수준의 활성도가 분포하였으나 Non-ROI Activation Mass도 0.2780으로 나타나 ROI 외부 영역에도 활성도가 일부 분산되어 있음을 확인할 수 있다. ROI Crop은 ROI Activation Mass가 0.6071로 나타났으며 ROI Feature Pooling은 ROI 영역의 특징만 분류기에 연결함에도 불구하고 ROI Activation Mass가 0.4569로 낮게 나타났다. 이는 입력을 crop하거나 ROI 특징을 직접 선택하는 방식만으로는 백본 특징 활성도를 ROI 중심으로 정렬하는 데 한계가 있음을 시사한다. 반면 RAR-LbC는 ROI Activation Mass가 0.9863으로 가장 높고 Non-ROI Activation Mass가 0.0137로 가장 낮게 나타났다. 이는 제안한 RAR 및 LbC 손실이 ROI 외부 활성도를 효과적으로 억제하고 분만 관련 ROI 영역으로 특징 활성도를 집중시키는 데 기여함을 의미한다. 결론적으로 제안한 RAR-LbC는 학습 과정에서 ROI 정렬을 직접 유도함으로써 분만 분류 성능을 전반적으로 향상시키는 효과적인 학습 전략임을 보였다.

표 6. Original 모델과 RAR-LbC의 성능 차이에 대한 대응표본 t-검정 결과

Table 6. Results of the Paired t-test for Performance Differences between the Original Model and RAR-LbC

RAR-LbC vs Original
Metric p-value
Recall 0.0345
Accuracy 0.0027
F1-score 0.0060
AUC < 0.0010

추가적으로 Original 모델과 RAR-LbC 간 성능 차이의 통계적 유의성을 확인하였다. 표 6은 동일한 데이터 분할 및 시드 조건에서 산출된 반복 실험 결과를 바탕으로 수행한 대응표본 t-검정 결과를 나타낸다. RAR-LbC는 Recall, Accuracy, F1-score, AUC에서 p-value가 각각 0.0345, 0.0027, 0.0060, < 0.0010으로 유의수준 0.05 기준 통계적으로 유의한 차이를 보였다. 이는 제안한 RAR-LbC가 Original 모델 대비 주요 성능 지표에서 유의한 성능 개선을 보였음을 의미한다.

4. 결 론

본 연구에서는 분만사에서 촬영한 모돈 분만 영상 데이터셋을 활용하여 프레임 단위의 분만 진행 여부를 판별하는 딥러닝 기반 분만 분류 시스템을 개발하였다. 제안된 RAR-LbC는 네트워크 구조를 변경하지 않고 손실 함수 설계를 통해 ROI 중심의 특징 표현 학습을 유도하는 학습 전략이다. RAR 손실은 ROI 외부에 분포한 활성 확률 질량에 벌점을 부여하여 특징 활성도가 ROI 내부에 집중되도록 유도하며 LbC 손실은 분류에 직접 사용되는 어텐션 분포가 ROI와 정렬되도록 정규화한다. 최종 손실 함수는 교차 엔트로피 손실에 RAR 손실과 LbC 손실을 가중합으로 결합하여 구성하였다.

실험 결과, 제안한 RAR-LbC는 Original 모델 대비 전반적인 분만 여부 분류 성능을 향상시켰으며 대응표본 t-검정 결과에서도 통계적으로 유의한 성능 차이를 보였다. 이는 ROI 영역을 입력 단계에서 직접 제한하는 방식이 아닌 손실 함수 기반의 정규화를 통해 ROI 중심의 특징 표현을 유도하는 전략이 분만 여부 분류 성능 개선에 효과적으로 작용하였음을 의미한다. 특히 RAR-LbC는 전체 특징 표현을 유지한 상태에서 분만 관련 ROI 정보가 분류 과정에 반영되도록 유도함으로써 실제 분만 프레임 탐지와 전반적인 판별 성능 향상에 기여하였다.

본 연구의 한계점은 다음과 같다. 첫째, 본 연구에서는 특정 분만사 촬영 환경에서 분만 관련 시각 단서가 주로 위치하는 영역을 기준으로 고정 ROI를 사전 정의하였으므로 카메라 위치, 촬영 각도, 돈방 구조가 달라지는 환경에서는 ROI 설정이 성능에 영향을 줄 수 있다. 둘째, 단일 농가에서 수집한 데이터셋을 기반으로 실험을 수행하였기 때문에 다양한 농장 환경과 촬영 조건에 대한 일반화 성능 검증이 추가로 필요하다. 셋째, 손실 가중치 민감도 분석을 통해 본 연구 조건에서의 적절한 가중치 설정을 확인하였으나 더 다양한 가중치 조합이나 학습 과정에서의 동적 가중치 조정까지는 검토하지 못하였다. 향후 연구에서는 다양한 농가 및 촬영 조건에서 수집된 데이터셋을 활용하여 제안 방법의 일반화 성능을 검증할 계획이다. 또한 고정 ROI 설정의 한계를 완화하기 위해 데이터 기반 ROI 추정 또는 약지도 기반 ROI 갱신 전략을 검토하고 학습 과정에서 RAR과 LbC의 기여도를 동적으로 조절할 수 있는 적응적 가중화 기법을 도입할 예정이다. 추가적으로 도메인 교란 기반 증강, 특징 정규화, 도메인 적응 기반 학습 전략을 결합하여 실제 분만사 환경 변화에 대한 모델의 강건성을 향상시키는 방향으로 연구를 확장할 계획이다.

Acknowledgements

This research was supported by the Basic Science Research Program through the National Research Foundation of Korea (NRF) funded by the Ministry of Education (No. 2022R1I1A3053872); in part by the National Research Foundation of Korea (NRF) grant funded by the Korea government (MSIT) (RS-2023-00242528) and was supported by Korea Institute of Planning and Evaluation for Technology in Food, Agriculture and Forestry(IPET) and Korea Smart Farm R Foundation (KosFarm) through Smart Farm Innovation Technology Development Program, funded by Ministry of Agriculture, Food and Rural Affairs (MAFRA) and Ministry of Science and ICT(MSIT), Rural Development Administration(RDA) (RS-2025-02315218).

References

1 
Ministry of Data and Statistics, Press Release, Jan. 23, 2026, accessed Feb. 28, 2026., "Livestock Statistics in the Fourth Quarter of 2025," 2026. Google Search
2 
Korea Rural Economic Institute, https://aglook.krei.re.kr/upload/observeFiles/e1016894cbd949cb88e3b62c73dd0784.pdf (published Sep. 2, 2025, accessed Feb. 28, 2026)., "Livestock Outlook: Pigs (September 2025)," 2025. URL
3 
K. L. Chidgey, P. C. H. Morel, K. J. Stafford, I. W. Barugh, "Sow and piglet productivity and sow reproductive performance in farrowing pens with temporary crating or farrowing crates on a commercial New Zealand pig farm," Livestock Science, vol. 173, pp. 87-94, 2015. DOI
4 
K. D. Vande Pol, A. F. Tolosa, C. M. Shull, C. B. Brown, S. A. S. Alencar, M. Ellis, "Effect of drying and/or warming piglets at birth on rectal temperature over the first 24 h after birth," Translational Animal Science, vol. 4, pp. 1-9, 2020. DOI
5 
M. Melišová, G. Illmann, H. Chaloupková, B. Bozděchová, "Sow postural changes, responsiveness to piglet screams, and their impact on piglet mortality in pens and crates," Journal of Animal Science, vol. 92, pp. 3064-3072, 2014. DOI
6 
T. Norton, C. Chen, M. L. V. Larsen, D. Berckmans, "Precision livestock farming: building ‘digital representations’ to bring the animals closer to the farmer," Animal, vol. 13, no. 12, pp. 3009-3017, 2019. DOI
7 
J.-H. Witte, J. Gerberding, C. Lensches, I. Traulsen, "Using Deep Learning for automated birth detection during farrowing," vol. P-328, pp. 141-153, 2022. Google Search
8 
T. Yun, J. Kim, J. Yun, T.-W. Um, "Automatic detection of trapping events of postnatal piglets in loose housing pen: comparison of YOLO versions 4, 5, and 8," Journal of Animal Science and Technology, vol. 67, no. 3, pp. 666-676, 2025. DOI
9 
F. Farahnakian, F. Farahnakian, S. Björkman, V. Bloch, M. Pastell, J. Heikkonen, "Pose estimation of sow and piglets during free farrowing using deep learning," Journal of Agriculture and Food Research, vol. 16, pp. 101067, 2024. DOI
10 
Y. Luo, E. Lv, X. He, Z. Zeng, J. Xia, "Sow farrowing detection and farrowing duration analysis based on Rotated Bounding Box and improved YOLOv8," Smart Agricultural Technology, vol. 13, pp. 101803, 2026. DOI
11 
M. Wutke, C. Lensches, U. Hartmann, I. Traulsen, "Towards automatic farrowing monitoring—A Noisy Student approach for improving detection performance of newborn piglets," PLOS ONE, vol. 19, no. 10, pp. e0310818, 2024. DOI
12 
M. Oczak, F. Bayer, S. Vetter, K. Maschat, J. Baumgartner, "Comparison of the automated monitoring of the sow activity in farrowing pens using video and accelerometer data," Computers and Electronics in Agriculture, vol. 192, pp. 106517, 2022. DOI
13 
M. Krichen, "Convolutional Neural Networks: A Survey," Computers, vol. 12, no. 8, pp. 151, 2023. DOI
14 
M. Tan, Q. V. Le, "EfficientNetV2: Smaller Models and Faster Training," vol. 139, pp. 10096-10106, 2021. Google Search
15 
I. Loshchilov, F. Hutter, "Decoupled Weight Decay Regularization," 2019. Google Search

저자소개

김지환 (Ji-hwan Kim)
../../Resources/kiee/KIEE.2026.75.8.1929/au1.png

Ji-hwan Kim is currently working toward the B.S. and M.S. degrees in the Department of Data Science, Kangwon National University, South Korea.

조현종 (Hyun-chong Cho)
../../Resources/kiee/KIEE.2026.75.8.1929/au2.png

Hyun-chong Cho received the M.S. and Ph.D. degrees in electrical and computer engineering from the University of Florida, Gainesville, FL, USA, in 2009. From 2010 to 2011, he was a Research Fellow with the University of Michigan, Ann Arbor, MI, USA. From 2012 to 2013, he was a Chief Research Engineer at LG Electronics, South Korea. He is currently a Professor with the Department of Electronics Engineering, the Department of Data Science, Kangwon National University, South Korea.