3.1 유효 특징을 이용한 특성 분석
본 절에서는 아크 발생 거리 변화에 따라 전류 신호로부터 추출된 특징 값이 어떠한 분포적 특성을 가지며, 아크 상태와 정상 상태 간의 차별성이 어떻게
변화하는지를 분석하기 위한 방법을 설명한다. 본 연구의 목적은 분류기 성능 향상이나 판정 임계값 도출에 있지 않고, 개별 특징 자체가 거리 변화에
대해 어떠한 물리적·통계적 특성을 보이는지를 정량적으로 관찰하는 데 있다.
이를 위해 분석 대상 특징은 2장에서 정의한 시간 영역, 주파수 영역, 그리고 시간–주파수 영역 기반 특징들 중 기존 교류 직렬 아크 검출 연구에서
널리 사용되어 온 대표적인 10개 특징으로 구성된다. 선정된 특징들은 평균 에너지 수준, 진폭 변동성, 파형의 비정상성, 고주파 성분 분포, 스펙트럼
구조 변화 등 서로 상이한 신호 특성을 반영하도록 구성되었으며, 각 특징의 정의와 해석적 의미는 표 1에 정리되어 있다. 이러한 구성은 특정 신호 도메인에 편중되지 않고, 거리 변화에 따른 다양한 신호 특성 변화를 포괄적으로 분석하기 위한 목적에서
이루어졌다. 이러한 특징 구성은 기존 교류 직렬 아크 검출 연구에서 반복적으로 사용되어 온 시간 영역, 주파수 영역, 그리고 시간–주파수 영역 특징
조합을 기반으로 하며, RMS, 분산, ZCR, 고주파 대역 에너지, 스펙트럼 엔트로피, THD, 스펙트럼 중심 주파수, 웨이블릿 에너지 비율 등은
직렬 아크의 비정상성을 효과적으로 반영하는 대표적인 특징으로 보고된 바 있다 [13-
15].
표 1에 제시된 각 특징은 동일한 전처리 및 계산 조건 하에서 추출된다. 모든 전류 신호는 DC 성분 제거 이후 분석되며, 시간 영역 특징은 신호의 진폭
및 변동 특성을 직접적으로 반영하고, 주파수 영역 특징은 FFT 기반 단측 파워 스펙트럼을 이용하여 계산된다. 이때 주파수 영역 특징 계산에는 $K=N/2$로
정의되는 단측 스펙트럼을 사용하며, 스펙트럼 엔트로피의 경우 전체 주파수 분포의 불균일성을 정규화된 형태로 평가한다. 또한 웨이블릿 기반 특징은 db4
웨이블릿의 레벨 4 상세 계수 에너지 비율을 사용하여 비정상 성분의 상대적 크기를 반영한다.
표 1. 본 연구에서 사용한 대표 특징의 정의 및 의미
Table 1. Mathematical definitions and physical interpretations of the representative
features used in this study
|
Feature
|
Mathematical definition
|
Physical interpretation
|
Signal domain
|
|
RMS
|
$RMS = \sqrt{\frac{1}{N}\sum_{n=0}^{N-1}x[n]^2}$
|
Average energy (amplitude) level
|
Time
|
|
Variance
|
$Var = \frac{1}{N}\sum_{n=0}^{N-1}(x[n]-\mu)^2$
|
Amplitude variability
|
Time
|
|
Peak-to-Peak
|
$P2P = \max(x[n]) - \min(x[n])$
|
Maximum amplitude range
|
Time
|
|
Crest Factor
|
$CF = \frac{\max_n|x[n]|}{RMS}$
|
Ratio of peak value to average energy
|
Time
|
|
ZCR
|
$ZCR = \frac{1}{N-1}\sum_{n=0}^{N-2}[s[n] \neq s[n+1]]$
$s[n] = sign(x[n]), s[n]=1 \text{ if } s[n]=0$
|
Frequency of sign changes, indicating waveform irregularity
|
Time
|
|
HF Energy Ratio (2–10 kHz)
|
$HF = \frac{\sum_{k \in B}|X[k]|^2}{\sum_{k=0}^{K}|X[k]|^2}, B=\{k: f_k \in [2, 10]kHz\}$
|
High-frequency band energy ratio
|
Frequency
|
|
Spectral Entropy (Norm.)
|
$H_{norm} = \frac{H}{\log_2(K+1)} \quad (K = \lfloor \frac{N}{2} \rfloor)$
$H = -\sum_{k}P(k)\log_2P(k), p_k = \frac{|X[k]|^2}{\sum_{i}|X[i]|^2}$
|
Spectral dispersion and disorder
|
Frequency
|
|
THD
|
$THD = \frac{\sqrt{\sum_{m=2}^{M}P_m}}{\sqrt{P_1}}$
|
Degree of harmonic distortion
|
Frequency
|
|
Spectral Centroid (Hz)
|
$SC = \frac{\sum_{k=0}^{K}f_k|X[k]|^2}{\sum_{k=0}^{K}|X[k]|^2}$
|
Center frequency of spectral energy
|
Frequency
|
|
Wavelet Detail Energy Ratio (db4, L4)
|
$WER = \frac{E_{D4}}{\sum_{j}E_j}$
|
Relative energy of nonstationary components
|
Time-Frequency
|
아크 발생 거리는 0 m, 10 m, 20 m, 30 m의 네 가지 조건으로 구분되며, 각 거리 조건에 대해 아크 상태와 정상 상태의 특징 값 분포를
독립적으로 분석한다. 특성 분석은 개별 특징이 아크 상태와 정상 상태를 얼마나 효과적으로 구분할 수 있는지를 통계적으로 평가하는 방식으로 수행된다.
이를 위해 각 특징에 대해 두 상태 간의 분포 차이를 반영하는 차별성 지표를 산출하며, 본 연구에서는 분산 기반 분석 기법을 활용하여 특징의 차별성을
정량화한다. 이러한 지표는 실제 판정에 사용될 임계값을 설정하기 위한 목적이 아니라, 거리 조건에 따른 특징 값 분포의 상대적 분리 정도를 비교·분석하기
위한 지표로 활용된다.
거리 변화에 따른 특징의 특성은 다음과 같은 세 가지 관점에서 분석된다. 첫째, 거리 증가에 따라 특징의 평균값 또는 중앙값이 어떠한 방향으로 이동하는지를
분석하여 특징 값의 전반적인 변화 경향을 파악한다. 둘째, 특징 값의 분산 및 분포 형태 변화를 통해 거리 조건에 따른 특징의 안정성과 민감도를 평가한다.
셋째, 동일한 특징이 서로 다른 거리 조건에서도 아크 상태와 정상 상태 간의 차별성을 일관되게 유지하는지 여부를 비교한다. 이를 통해 특정 거리에서
유효한 것으로 판단된 특징이 다른 거리 조건에서도 동일한 판별 특성을 보이는지, 혹은 거리 증가에 따라 유효성이 저하되는지를 체계적으로 분석한다.
3.2 유효 특징 순위 분석
본 절에서는 거리 조건에 따른 특징 값의 절대적 변화뿐만 아니라, 각 특징이 아크 상태와 정상 상태를 구분하는 데 기여하는 상대적 중요도가 거리 변화에
따라 어떻게 달라지는지를 정량적으로 분석한다. 즉, 3.1절이 거리별 특징 값의 분포 이동과 분산 변화를 관찰하는 데 초점을 두었다면, 본 절은 거리
조건별로 어떤 특징이 더 유효한가를 비교하기 위해 유효 특징 순위 분석을 수행한다. 이러한 접근은 특정 특징이 모든 거리에서 일정 수준의 차별성을
갖는지 여부뿐 아니라, 거리 변화에 따라 특징 선택 결과(상위 특징 집합)가 얼마나 안정적으로 유지되는지를 평가하는 데 목적이 있다.
유효 특징 순위는 각 특징에 대해 아크 집단과 정상 집단 사이의 분포 차이를 반영하는 차별성 지표를 산출하고, 이를 기준으로 특징을 내림차순 정렬하여
얻는다. 본 연구에서는 분산 기반 분석 기법을 사용하므로, 거리 및 부하 조건에서 특징의 차별성은 일원분산분석(ANOVA) 기반의 효과 크기(effect
size)를 사용한다[16].
거리 $d$, 부하 $l$에서 특징 $f$의 전체 표본수를 $N$, 집단 평균을 $\mu_1, \mu_2$라면, 집단 간 제곱합(SSB)과 집단 내
제곱합(SSW)은 다음과 같이 정의된다. 또한, SST는 전체 표본의 변동성을 의미하며, SSB와 SSW의 합으로 계산된다.
이 때 특징 $f$의 차별성 지표로 아래 식에 나타낸 효과크기 $\eta^2$을 사용한다.
$\eta^2$는 전체 변동 중 집단(아크/정상) 차이에 의해 설명되는 비율을 의미하며, 값이 클수록 해당 특징이 두 집단을 더 잘 구분하는 경향이
있음을 의미한다. 본 연구에서는 동일 거리·부하 조건 내에서 $\eta^2$ 값이 큰 특징을 상위로 두어 유효 특징 순위를 구성한다.
거리 $d$ 및 부하 $l$에 대해 각 특징 $f$의 $\eta^2$을 계산한 뒤 다음과 같이 순위함수를 정의한다.
여기서 $\mathbf{r}_{d,l}$는 거리 $d$, 부하 $l$에서의 특징 순위벡터이며, 순위가 1일수록 가장 유효한 특징(차별성 최상위)을
의미한다. 동일 거리 조건 내에서 얻은 유효 특징 순위를 비교함으로써, 특정 거리에서 중요한 특징이 다른 거리에서도 동일하게 중요한지 여부를 분석한다.
또한, 거리 변화에 따른 순위 변동성을 정량화하기 위해, 서로 다른 두 거리 $d_i, d_j$에서 얻어진 순위 간 유사도를 평가한다. 본 연구에서는
순위 상관 기반 지표와 상위 특징 집합 중첩 기반 지표를 병행하여 순위의 안정성을 분석한다. 순위 상관 기반 지표로는 Spearman 순위 상관계수를
이용하였다[17]. Spearman 순위 상관계수는 두 변수 간의 단조(monotonic) 관계를 순위 정보를 기반으로 평가하는 비모수적 상관 지표로, 특징 값의
절대적 크기보다는 상대적 순위 일치도를 평가하는 데 적합하다.
두 순위 벡터 $\mathbf{r}_{d_i}, \mathbf{r}_{d_j}$ 간 Spearman 순위 상관계수 $\rho_s$는 다음과 같이 정의된다.
여기서, $N$은 전체 특징의 개수를 의미하며, $\rho_s$는 $-1 \leq \rho_s \leq 1$의 범위를 갖는다. $\rho_s$가 1에
가까울수록 두 거리 조건에서의 특징 순위가 높은 일관성을 가지며, 0에 가까울수록 순위 간의 상관성이 낮음을 의미한다.
상위 특징 집합 중첩 기반 지표는 거리 변화에 따라 실제로 선택되는 핵심 특징 집합이 얼마나 일관되게 유지되는지를 평가하기 위해, Top-m 특징
집합의 중첩률(overlap)을 이용한다[18]. 거리 $d$, 부하 $l$ 조건에서의 상위 $m$개 특징 집합은 다음과 같이 정의된다.
여기서 $r_i^{(d,l)}$는 거리 $d$, 부하 $l$ 조건에서 특징 $f_i$의 순위를 의미한다. 서로 다른 두 거리 $d_a, d_b$에서
얻어진 상위 $m$개 특징 집합간의 중첩률은 다음과 같이 정의된다.
이 지표는 두 거리 조건에서 선택된 상위 특징 집합이 얼마나 일치하는지를 0과 1 사이의 값으로 정량화한다. 중첩률이 1에 가까울수록 두 거리 조건에서
동일한 특징들이 핵심 특징으로 선택되었음을 의미하며, 0에 가까울수록 거리 조건 변화에 따라 선택되는 핵심 특징 집합이 크게 달라짐을 의미한다.