Source-linked AI summary

Decoding the Past: An Uncertainty-Aware Deep Learning Framework for Sex Attribution in Prehistoric Hand Stencils

Karel Becerra, Boris Mederos, Dean Snow, Ramón A. Mollineda

arXiv:2608.14539v1cs.CVcs.AIcs.LG

TL;DR

선사시대 손 스텐실의 생물학적 성 판별은 형태 중첩, 집단 차이, 영상 열화, ground truth 부재로 제한된다. 본 연구는 다층적 uncertainty-aware 실루엣 및 ensemble framework를 사용해 일부 스텐실에서는 안정적인 예측을 산출하고, 다른 스텐실은 모호한 사례로 식별한다. 이러한 결과는 고고학적 해석에서 uncertainty를 잡음이 아닌 분석 가능한 증거로 다뤄야 함을 뒷받침한다.

  • 문제

    선사시대 손 스텐실의 성 판별은 확정적인 ground truth가 없으며, 형태 중첩, 집단 변이, 낮은 일반화 가능성, 주관적으로 설계된 handcrafted feature로 제한된다.

  • 방법

    본 연구는 실루엣 추출 및 augmentation, ensemble classification, post-hoc analysis를 통해 uncertainty를 모델링하고, 전파하고, 집계한다.

  • 결과

    본 framework는 여러 선사시대 스텐실에서 안정적인 예측을 산출하는 한편, 감소된 실루엣 지지와 낮은 classification margin을 통해 다른 사례를 본질적으로 모호한 것으로 식별했다.

  • 시사점 및 한계

    신뢰도 지표는 불확실한 고고학적 증거의 과잉 해석을 완화하는 데 도움을 줄 수 있으며, 해부학적으로 조직된 attribution은 생물학적으로 타당한 classifier 동작을 뒷받침한다.

  • 시사점 및 한계

    선사시대 스텐실의 성은 직접 관찰된 것이 아니라 contemporary reference model로부터 추론되므로, 확정적인 ground truth는 확보할 수 없다.

Abstract

from arXiv · show

Determining the biological sex of the individuals who created Upper Paleolithic hand stencils remains a challenging problem due to the absence of ground truth, population differences between contemporary and prehistoric groups, and the uncertainty introduced by image degradation. Traditional morphometric methods suffer from high structural overlap across sexes, poor cross-population generalizability, and subjective feature engineering. This study presents an uncertainty-aware deep learning framework for sex attribution in prehistoric hand stencils that explicitly models, propagates, and aggregates uncertainty throughout the analytical pipeline. The methodology combines dual image processing, dual contour extraction, structured silhouette augmentation, model architectural diversity, and ensemble-based decision aggregation. The pipeline generates twelve plausible silhouette realizations per stencil to capture boundary uncertainties, which are processed by two ensembles of ten deep neural networks each (EfficientNet-B3 and MobileViT-S) trained on 14,036 contemporary hand samples. Furthermore, a triangulated validation scheme integrates ensemble predictions with unsupervised 2D latent-space manifold mapping (UMAP + k-NN) and explainable AI spatial attributions (LayerCAM) to ensure anatomical consistency. On contemporary data, ensemble models achieve strong classification performance, with accuracies exceeding 88% in older age groups. When applied to prehistoric stencils, the framework produces both sex predictions and confidence measures of internal agreement, enabling the distinction between morphologically stable and ambiguous cases. Convergence across ensemble predictions, latent-space structure, and interpretability analyses shows that uncertainty can become a measurable component of archaeological inference, enabling robust and reproducible decoding of ancient rock art.

1. 서론

선사시대 손 스텐실에서 성별을 추정하는 일은 유망하지만, 성별 형태의 중첩, 집단 간 전이의 어려움, 이미지 열화, 불확실한 스텐실 경계로 제약된다. 본 연구는 가능한 실루엣을 생성하고, 앙상블 예측을 잠재공간 및 해석 가능성 분석과 삼각 검증하는 불확실성 인식 프레임워크로 이러한 한계를 다룬다.

  • 문제: 전통적 형태측정학 방법은 상당한 손 크기 중첩, 주관적인 수작업 특징, 낮은 데이터셋 간 일반화 성능, 형태 표현의 제한으로 제약된다.이러한 접근법은 크기, 각도, 손가락 비율과 같은 측정값에 의존하는 반면, 자동화된 machine-learning 접근법은 한계를 부분적으로만 해결했다.
  • 한계: 열화, 불완전한 보존, 조명 변화, 표면 불규칙성, 모호한 경계는 segmentation과 contour delineation에 불확실성을 유발하며, 3D 재구성과 orthoprojection은 추가 오류를 전파할 수 있다.photogrammetric 3D 모델과 2D orthophoto가 시점 및 스케일 관련 왜곡을 줄이더라도 이러한 한계는 지속된다.
  • 기여: 이 프레임워크는 선사시대 손 스텐실의 성별 추정을 위한 deep-learning pipeline 전반에서 불확실성을 명시적으로 모델링하고, 전파하며, 집계한다.이는 기존의 classifier-ensemble 및 spatial-attribution 접근법 (Mollineda et al. 2025)을 확장하여 분석 단계 전반의 불확실성 관리를 강화한다.
  • 기여: 구조화된 실루엣 표현은 이중 주석, 형태학적 섭동, 다중 채널 조성을 통해 여러 개의 가능한 contour 실현을 생성한다.이 전략은 단일 추출 경계에 의존하기보다 주석 및 형태학적 불확실성을 포착하도록 설계되었다.
  • 기여: 삼각 검증 체계는 앙상블 예측, UMAP + k-NN 잠재공간 분석, 집계된 LayerCAM map을 결합하여 수렴하는 증거를 제공하고 인식론적 안정성을 진단한다.9개의 선사시대 손 스텐실 사례를 예측, 신뢰도 측정값, 잠재공간 구성, spatial attribution 패턴을 통해 공동 분석하여, 매우 일관된 결과부터 모호한 결과까지 포괄한다.

2. 선행 연구

선사시대 손 스텐실의 성별 추정 연구는 판별분석과 수작업 측정에서 기하형태계측과 딥러닝 파이프라인으로 발전해 왔다. 그러나 모집단 간 전이 가능성, 부재한 ground truth, 그리고 사람이 수작업으로 delineate한 열화 스텐실 윤곽에서 비롯되는 불확실성은 여전히 핵심 과제다.

  • 방법론의 발전: 문헌은 선형 측정과 손가락 비율에서 landmark 기반 형태계측과 contemporary hand data에서 자동으로 학습된 특징으로 이동해 왔다.검토한 연구는 Paleolithic, simulated, contemporary hand data를 아우르며, 특징 추출은 수작업 측정부터 deep learning까지 다양하다.
  • 전통적 판별 방법: Snow (2006)은 현대 유럽 성인 111명의 손과 손가락 길이를 사용한 2단계 판별 접근법을 도입해, 손이 큰 성인 남성과 손이 작은 개체를 구분했다.손이 작은 집단에는 고고학적 맥락에서 성인 여성과 미성년자가 포함될 수 있다.
  • 자동 특징 추출: Wang et al. (2010)은 HSV 변환과 K-means clustering을 사용해 윤곽 추출을 자동화한 뒤, 중지 길이를 기준으로 D2:D4 ratio를 포함한 기하학적 특징을 정규화했다.이 파이프라인은 contemporary hand images에서 손가락 끝과 골짜기 landmark, 손가락 및 손바닥 치수, 기타 측정값을 추출했다.
  • 모집단 간 일반화 가능성: 한 모집단에서 학습한 모델은 일반화 성능이 저조할 수 있다: Snow의 미국 데이터 학습 판별함수는 평균 손 크기 차이 때문에 독립적인 프랑스 데이터셋에서 크게 편향된 분류를 산출했다.Galeta et al. (2014)은 프랑스인 오른손 프린트 100개와 leave-one-out validation을 사용해 이 문제를 평가했다.
  • 지속되는 한계: 선사시대 스텐실 추론에는 결정적인 ground truth가 없으며, 수작업으로 추적한 실루엣은 관찰자 간 차이, 안료 확산, 암석 질감, 보존 상태에 취약해 윤곽 오류가 예측 불확실성을 증폭시킬 수 있다.이러한 한계는 contemporary reference models의 타당성과 실루엣 기반 분류의 신뢰성 모두에 영향을 미친다.

3. 재료 및 방법 · 3.1. 개요

이 연구는 실루엣 기반 computer vision pipeline을 사용해 선사시대 동굴 손 스텐실에서 생물학적 성을 추론한다. 이 pipeline은 실루엣 추출 및 증강, ensemble 기반 분류, 사후 분석으로 구성된다.

  • 3.1. 개요: 이 pipeline은 실루엣 기반 computer vision을 사용해 선사시대 동굴 손 스텐실에서 생물학적 성을 추론한다.전체 구성은 Figure 2에 제시되어 있다.
  • 3.1. 개요: 첫 번째 단계에서는 분류에 앞서 스텐실 실루엣을 추출하고 증강한다.
  • 3.1. 개요: 두 번째와 세 번째 단계에서는 ensemble 기반 실루엣 분류를 수행한 뒤 사후 분석을 실시한다.

3.2. 데이터셋

이 연구는 DNN 학습을 위한 주석 처리된 현대 손 X-ray 14,036개와 독립적인 사례 연구에 사용된 선사시대 손 스텐실 9개를 결합한다. 모든 샘플은 통합된 실험 프레임워크 안에서 이진 손 실루엣으로 표현된다.

  • 데이터 표현: 현대 방사선 사진과 선사시대 스텐실은 모두 이진 손 실루엣으로 변환되어, 통합된 실험 프레임워크 안에서 함께 분석할 수 있다.이 표준화된 표현은 두 데이터 소스 모두에 제안 방법론을 적용할 수 있도록 한다.
  • 현대 데이터셋: 생후 1개월부터 19세까지의 소아 환자에서 좌손 X-ray 14,036개를 두 기관으로부터 수집하고, 학습 샘플 12,611개와 검증 샘플 1,425개로 분할했다.두 기관은 각각 이미지 2,983개와 11,053개를 제공했다.
  • 현대 데이터셋: 현대 데이터셋의 연령별 클래스 분포는 10세에서 16세 사이에 집중되며, 이 시기에 성적 이형성을 보이는 손의 특성이 더 안정적이고 뚜렷해진다.남성 및 여성 클래스는 각각 단봉 분포와 쌍봉 분포를 보인다.
  • 선사시대 사례 연구: 두 출처에서 확보한 선사시대 손 스텐실 9개는 독립적인 사례 연구로 사용되었으며, 보존 상태가 양호한 El Castillo 샘플 4개와 최소 4개 유적에서 이전에 분석된 이미지 5개로 구성된다.El Castillo 샘플은 대비와 명확한 윤곽을 기준으로 선정했으며, 두 번째 하위 집합에는 Mollineda et al. 2025에서 제시된 기존 성별 귀속 가설이 있었다.

3.3. 방법론

이 방법론은 여러 실루엣 표현, 다양한 앙상블, 계층적 집계, 사후 검증을 결합해 불확실성을 성별 귀속의 측정 가능하고 전파되는 구성요소로 다룬다. 이 통제된 합의 시스템은 광범위한 하이퍼파라미터 최적화에 의존하지 않고 저하된 이미지, 윤곽 모호성, 모델 변동성, 제한된 ground truth에 대응한다.

  • 3.3. 방법론: 이 프레임워크는 실루엣 추출, 증강, 앙상블 분류, 계층적 집계, 사후 구조 및 해석 가능성 검증 전반에 불확실성을 전파한다.핵심 원칙은 판단에 앞선 다중화, 구조화된 섭동, 아키텍처 다변화, 계층적 집계, 명시적 내부 합의 정량화다.
  • Phase 1 실루엣 추출 및 증강: 각 스텐실에서 생성한 12개의 실루엣 표현은 이중 이미지 처리, 독립 윤곽, 이진 형상 연산자, 형태학적 보간, 3채널 변형을 결합한다.이중 경로는 저하된 동굴 이미지에 대한 대안적 해석을 보존하며, 구조화된 섭동은 허용 가능한 윤곽 및 형태학적 변동성을 나타낸다.
  • Phase 2 실루엣의 앙상블 기반 분류: 두 아키텍처 EfficientNet-B3와 MobileViT-S는 각각 12개 변형에 대해 10회의 독립 실행을 수행하며, 스텐실당 240개의 확률 예측을 생성한다.예측은 합 기반 및 최댓값 기반 전략으로 융합하며, 실루엣 지지도는 변형 간 형태학적 합의 정도를 측정한다.
  • Phase 3 사후 분석: 사후 검증은 앙상블 예측을 2D manifold k-NN 분류와 비교하고, 120개의 EfficientNet attribution map을 geometric median으로 집계한다.latent space에서의 합의는 구조적 견고성을 검증하며, 집계된 map은 설명 노이즈와 모델별 artifact를 줄인다.
  • Phase 2 실루엣의 앙상블 기반 분류: 합의 전략은 실루엣 변형, 아키텍처, 모델 인스턴스 전반의 약한 예측을 집계해 outlier에 대한 견고성을 높이고 분류 결과를 안정화한다.이러한 다양성은 ground truth의 부재, domain shift, 선사시대 윤곽 추적의 주관성에서 비롯되는 불확실성에 대응한다.
  • 3.3. 방법론: 접근 가능한 추론 프레임워크를 우선하기 위해 명시적 하이퍼파라미터 최적화는 생략했으며, 더욱 철저한 튜닝은 개선 과제로 제시한다.따라서 이 방법론은 포괄적 벤치마킹으로 예측 성능을 극대화하기보다 비전문가의 사용성을 강조한다.

4. 실험

실험 결과, ensemble prediction은 contemporary silhouette에서 정확하고 architecture 전반에 걸쳐 안정적이며, confidence metric과 독립적인 latent-space 분석은 prehistoric 사례의 일치도와 모호성을 정량화했다. Model relevance는 손 전체나 배경 구조보다 해부학적으로 의미 있는 손가락 기하와 손가락 사이 간격에 집중되었다.

  • Contemporary benchmark: Contemporary classification accuracy는 피험자 연령이 증가할수록 향상되었으며, 이는 고연령층 표본이 더 조밀하게 수집되고 성적 이형성이 점차 뚜렷해진 결과일 가능성이 있다.성능은 고연령층에서 가장 높았고, [0–6) cohort는 상대적으로 근거가 부족했다.
  • Contemporary benchmark: [0–6) age stratum에서 76.2% ensemble accuracy는 개별 EfficientNet-B3 instance의 68.1% ± 1.9%를 상회했다.Ensemble은 개별 instance 평균 성능을 일관되게 능가했으며, 특히 최연소 피험자에서 그 차이가 컸다.
  • Contemporary benchmark: EfficientNet-B3는 대체로 MobileViT-S보다 우수했지만, 제한된 task와 hyperparameter tuning의 부재로 인해 architecture 우월성에 대한 일반적 주장은 배제된다.Architecture 비교는 하나의 특화 task에 적용된 특정 model variant를 대상으로 수행되었다.
  • Prehistoric attribution: 높은 SSR과 ACM은 형태학적으로 안정적인 prehistoric 사례를 식별한 반면, 낮은 값은 모호한 stencil에 해당했으며 확신도 높은 분류를 강제하지 않고 불확실성을 보존했다.각 stencil당 120개 individual prediction을 aggregation한 결과, architecture와 aggregation strategy 전반에서 안정적인 일치가 나타났다.
  • Latent-space validation: 아홉 사례 모두에서 k-NN label은 EfficientNet-B3 ensemble prediction과 일치했으며, 이는 2D dimensionality reduction 이후에도 sex-related structure가 분리 가능한 상태로 유지되었음을 보여준다.img_26, img_28, Cosquer, El Castillo 25에서 지지가 가장 강했으며, 중간 수준의 지지도 assignment를 바꾸지 않았다.
  • Explainability: LayerCAM relevance는 손가락, 손가락 사이 공간, 지골, 중수골두에 집중되었고, 손바닥과 손목의 activation은 미미했다.이 공간적 패턴은 전반적인 손 크기나 배경 구조보다 손가락 기하와 상대적 간격에 의존함을 나타낸다.

5. 논의

이 프레임워크는 불확실성을 성 판별의 측정 가능하고 전파되는 구성요소로 다루며, 예측, latent-space, attribution 증거를 결합해 안정적인 분류와 모호한 분류를 구분한다. 고고학적 해석은 contemporary reference populations에 의존하고 prehistoric ground truth가 없다는 점 때문에 여전히 제한된다.

  • 5. 논의: 불확실성은 계층적 집계에 앞서 image processing, contour extraction, silhouette perturbation, representation, model 단계 전반에서 모델링되고 전파된다.이 다층 설계는 불확실성을 억제해야 할 noise가 아니라 정보로 다룬다.
  • 5. 논의: UMAP–k-NN validation과 LayerCAM map의 geometric-median aggregation은 probability estimates를 넘어 구조적 및 설명적 점검을 제공한다.각 LayerCAM map은 120개의 attribution instances를 결합해 contour variants와 stochastic model variation 전반에서 relevance patterns를 안정화한다.
  • 5. 논의: Attributions는 fingers, interdigital spaces, phalanges, metacarpal heads를 일관되게 강조하는 반면 palm과 wrist에는 비교적 낮은 relevance를 부여한다.이 영역에는 골격 연구에서 sexual dimorphism의 중요한 원천으로 앞서 확인된 구조가 포함된다.
  • 5. 논의: predictive aggregation, latent-space separability, attribution coherence 사이의 일치는 형태학적으로 안정적인 분류를 뒷받침하는 반면, 발산은 구조적으로 모호한 사례를 식별한다.SSR ≈1인 사례는 국소화되고 조직적인 activation patterns를 보이며, 불일치하거나 silhouette support가 감소하면 더 확산된 relevance가 나타난다.
  • 5. 논의: 이 프레임워크는 binary sex labels만이 아니라 predictions, confidence, latent-space organization, attribution patterns를 공동 분석함으로써 고고학적 해석을 지원한다.강하게 일관된 사례는 높은 silhouette support, 큰 classification margins, 일관된 latent-manifold positioning, 그리고 ensemble과 k- 사이의 일치로 특징지어진다.
  • 5. 논의: prehistoric ground-truth sex labels가 존재하지 않기 때문에 이 방법은 contemporary reference populations에 의존하며, 일부 sexual-dimorphism signatures가 긴 시간 규모에 걸쳐 지속된다고 가정한다.이 가정은 Upper Paleolithic populations에 대해 직접 검증할 수 없으므로, 더 풍부한 plausible-shape representations, predictive uncertainty modeling, broader probabilistic scaling이 필요하다.

6. 결론 · 윤리 승인

이 연구는 선사시대 손 스텐실의 성별 귀속에서 불확실성을 분석 파이프라인 전반에 걸쳐 모델링하고, 전파하며, 집계해야 할 유용한 구성요소로 제시한다. 수렴하는 증거는 형태학적으로 안정적인 분류를 뒷받침하는 반면, 불일치는 신중한 해석이 필요한 모호한 사례를 식별한다.

  • 6. 결론: 이 프레임워크는 이미지 획득, 주석, 실루엣 표현, 모델 학습, 의사결정 전반에 걸쳐 불확실성을 모델링하고, 전파하며, 집계한다.통제된 변동성과 계층적 집계를 결합한다.
  • 6. 결론: 현대 손 실루엣 실험은 앙상블 deep learning이 성적 이형 형태를 안정적으로 포착함을 보여주며, 특히 이러한 형질이 더 강하게 발현되는 연령대에서 그러하다.
  • 6. 결론: 선사시대 스텐실에 적용하면, 이 프레임워크는 일부 사례에서 안정적인 예측을 산출하는 한편, 감소한 실루엣 지지와 낮은 분류 마진을 통해 다른 사례를 본질적으로 모호한 것으로 식별한다.
  • 6. 결론: 삼각검증은 앙상블 분류, 비지도 해석 가능한 2D latent-space 검증, 집계된 LayerCAM 설명을 결합한다.이 관점들 사이의 일치는 일관된 잠재 표현과 해부학적으로 의미 있는 시각적 단서를 뒷받침한다.
  • 6. 결론: 예측, 구조, 해석가능성 분석 전반의 일치는 형태학적으로 안정적인 분류에 대한 수렴하는 증거를 제공한다.
  • 6. 결론: 분석 간 발산은 이용 가능한 증거가 확정적 귀속에 여전히 불충분한 사례를 부각하며, 불확실성을 단순한 오류 원천이 아니라 신뢰도 신호로 만든다.
  • 6. 결론: 향후 연구에서는 입력 변동성을 표현하고 예측 불확실성을 정량화하기 위해 보다 명시적으로 확률론적인 정식화를 개발해야 한다.이러한 발전은 형태학적 모호성과 모델 관련 불확실성을 구분하는 데 도움이 될 수 있다.
Loading 2608.14539v1…