개요
논문 "Knowledge Assembly: Semi-Supervised Multi-Task Learning from Multiple Datasets with Disjoint Labels"는 여러 작업의 데이터가 불완전하거나 일부만 레이블링된 실제 환경을 위한 새로운 머신러닝 접근법을 제시합니다. 이 연구는 서로 분리된 데이터셋을 다중 작업 학습, 즉 MTL 프레임워크에서 효과적으로 활용하는 방법을 다룹니다.
핵심은 서로 다른 작업의 레이블을 가진 여러 출처의 데이터를 효과적으로 결합하는 Knowledge Assembly 모델 학습 방법입니다. 이 방법은 추가적인 비레이블 데이터를 학습에 활용하는 반지도 학습, 즉 SSL 기법을 적용합니다. 구체적으로는 모델 증강 전략으로 레이블이 부족한 데이터를 의사 감독합니다. 사람 재식별과 보행자 속성 인식 작업에서 이 접근법을 시험했고, 기존 단일 작업 학습보다 유의미한 개선을 확인했습니다.
결과는 데이터가 부족하거나 불완전한 실제 환경에서도 이 방법을 적용할 수 있음을 보여줍니다. 하나의 시각 입력에서 여러 작업을 예측해야 하는 영상 보안과 자율주행 등의 분야에 활용할 수 있습니다.
연구 동기
머신러닝에서는 사용 가능한 데이터의 잠재력을 충분히 활용하는 일이 중요한 과제입니다. 많은 경우 모델은 특정 작업에 필요한 이미지 정보만 추출하고 나머지 정보는 활용하지 않습니다. 예를 들어 야외 장면으로 깊이 추정기를 학습하면 카메라와 물체 사이의 상대적 거리에만 관심을 두고 자동차, 건물, 나무, 사람과 같은 물체의 종류는 무시합니다. 이 논문은 다중 작업 학습을 사용해 이 문제를 다루는 새로운 접근법을 소개합니다. MTL은 작업 사이의 공통점과 차이를 활용해 학습 효율과 예측 정확도를 함께 개선할 수 있습니다. 앞의 예에서 물체의 종류를 학습하면 "나무와 건물은 사람보다 뒤에 있는 경향이 있다"거나 "하늘과 구름은 보통 먼 배경에 있다"는 패턴을 파악해 깊이를 더 잘 예측할 수 있습니다. 여러 작업이 하나의 네트워크 안에서 정보를 공유하며 함께 학습하므로 개별 작업의 성능뿐 아니라 전체 추론 시간도 줄일 수 있습니다.
기존 MTL 접근법의 일반적인 한계는 모든 작업에 대해 완전히 레이블링된 단일 데이터셋에 의존한다는 점입니다. 이는 실제 환경과 맞지 않는 경우가 많습니다. 그림 1처럼 대부분의 데이터셋은 특정 작업에 대해서만 레이블이 있고 다른 작업의 주석은 없습니다. 모든 데이터셋에 모든 작업의 레이블을 붙이는 데는 많은 시간과 자원이 필요합니다.
이 연구는 이러한 간극을 바탕으로 일부만 레이블링된 데이터셋을 MTL 프레임워크에서 사용할 필요를 다룹니다. 데이터 가용성의 현실적인 제약에 맞으면서, 사용 가능한 데이터를 더 효과적으로 활용하는 방법을 제시합니다.

그림 1. 문제 정의. 작업 1의 정답 레이블만 있는 데이터셋 A와 작업 2의 정답 레이블만 있는 데이터셋 B로 두 작업을 함께 학습합니다. 데이터셋 A에서 작업 2의 정보를, 데이터셋 B에서 작업 1의 정보를 어떻게 추출할지가 이 논문의 질문입니다.
작동 방식
Knowledge Assembly, 즉 KA는 반지도 학습 프레임워크 안에서 설계됐습니다. 그림 2는 전체 구조를 보여줍니다. 같은 네트워크 모델의 인스턴스 두 개를 초기화한 뒤 두 작업의 입력 이미지를 두 모델에 모두 전달합니다. 두 모델은 완전히 독립적이며 가중치를 공유하지 않습니다. 관련 정답 레이블이 있는 입력에는 기존의 지도 손실을 계산합니다. 예를 들어 데이터셋 A의 이미지에 대한 모델 출력은 작업 1의 정답 레이블로 감독합니다.
한 모델 인스턴스의 출력을 다른 모델 인스턴스를 감독하는 의사 레이블로 사용하고, 반대 방향으로도 적용하는 반지도 일관성 손실도 설계했습니다. 예를 들어 데이터셋 A의 이미지에 레이블이 없으면 모델 L의 출력을 모델 R의 출력으로 감독합니다. 이 방법을 MTL 프레임워크에 결합하면 서로 겹치지 않는 주석을 가진 부분 레이블 데이터셋으로 여러 작업을 동시에 학습할 수 있습니다.

그림 2. 방법 개요. 입력은 데이터셋 A와 B이고 출력은 작업 1과 2에 대응합니다. 데이터셋 A에는 작업 1의 레이블만, 데이터셋 B에는 작업 2의 레이블만 있습니다. 두 모델을 초기화해 정답 레이블이 없을 때 의사 감독을 제공합니다. 추론할 때는 더 나은 모델 하나만 사용합니다.
결과
사람 재식별과 보행자 속성 인식 두 작업에서 정확도가 개선됐습니다.
- 사람 재식별에서는 KA를 사용했을 때 정확도가 72%에서 76%로 4% 개선됐습니다.
- 보행자 속성 인식에서는 정확도가 82%에서 83%로 1% 개선됐습니다.
그림 3에서 볼 수 있듯이, 이 방법은 단일 작업 모델과 달리 사람을 올바르게 찾고 나이와 성별을 정확하게 예측했습니다.
KA는 MTL과 SSL을 결합해 대부분의 지표에서 모든 기준 모델보다 높은 성능을 보였습니다. 관련 작업을 함께 학습하고 레이블이 없는 데이터를 활용하면 작업 성능을 높일 수 있다는 결과입니다. 서로 다른 레이블을 가진 데이터셋이 흔한 실제 환경에서 특히 유용합니다.

그림 3. 공개 데이터셋의 결과. 사람 재식별과 보행자 속성 인식을 함께 학습하면 개별 학습보다 더 나은 예측을 얻습니다. 초록색은 올바른 예측, 빨간색은 잘못된 예측입니다. M은 남성, F는 여성, A는 성인, O는 노년을 뜻합니다.
마치며
이 논문은 MTL을 위한 새로운 접근법을 제시하고, 데이터가 불완전한 환경의 머신러닝 문제를 다루는 방법을 제안합니다. 서로 분리된 데이터셋을 반지도 학습 기법으로 결합한다는 점에서 후속 연구와 실제 적용에 활용할 수 있습니다.
