똑똑한 '농생명 데이터 관리'로 연구 효율 높인다
발표일
2026.09.17
부처
농촌진흥청
보도자료
보도 시점
-
- 15.(화) 11:00
-
16.(수) 조간
배포
-
- 15.(화) 06:00
똑똑한 ‘농생명 데이터 관리’로 연구 효율 높인다
-
농촌진흥청, ‘농생명 연구 자료 품질관리 자동화 기술’ 개발
-
사람이 하던 ‘전문가 내용 검증’에 슈퍼컴퓨터와 인공지능 투입
-
데이터 품질 검증에 쓰이는 인력과 시간 획기적으로 절감
농촌진흥청(청장 이승돈)은 농업의 인공지능 대전환(AX)을 뒷받침하기 위해 ‘농생명 연구 자료 품질관리 자동화 기술’을 개발했다.
유전체‧전사체(생명체 내 유전 정보 및 발현 정보) 연구 등에서 생산된 농생명 데이터는 그동안 농촌진흥청 국립농업과학원 ‘국립농생명공학정보센터(나빅, NABIC)’에 기탁됐다.
이렇게 기탁된 농생명 데이터를 빅데이터 분석에 활용하려면, 원시 자료의 질적 오류와 과학적 정밀성을 검증하는 ‘내용 검증’을 거쳐야 한다. 이 과정에서 훈련된 전문 인력이 일일이 검증 절차를 밟다 보니, 시간이 오래 걸리는 문제가 야기돼 빅데이터 활용 연구의 병목으로 지목되고 있다.
최근에는 데이터 기탁량이 급증하면서 내부 전문가만으로는 대응에 한계를 드러내고 있다. 실제로 나빅은 약 536만 건(75TB) 이상의 빅데이터를 보유하고 있으며, 매년 약 20%씩 데이터가 증가해 과학적 신뢰성을 확보할 수 있는 새로운 품질관리 체계 구축이 필요하다.
이번에 개발한 ‘농생명 연구 자료 품질관리 자동화 기술’은 농촌진흥청의 슈퍼컴퓨터와 인공지능 기술을 결합한 것이 핵심이다. 유전 정보의 파일 구조를 자동으로 분석하고, 표준화된 품질 지표를 적용해 데이터를 관리한다. 특히 인공지능이 데이터 누락 여부를 판단하고, 분류 알고리즘으로 실제 분석에 적합한 품질인지 정밀하게 채점해 연구자에게 알려주는 기능을 갖췄다.
데이터 관리 과정은 총 4단계로 이뤄진다. ∆1단계에서는 슈퍼컴퓨터가 표준화 과정에 맞게 원시 자료를 전처리하고, ∆2단계에서 인공지능이 헤더 정보*와 실험 날짜 등을 분류한다. ∆3단계에서는 데이터 유형별 특성에 맞춰 인공지능이 정량적 기준을 적용해 오류를 추적하고 자동 채점하며, ∆4단계에서 최종 품질 점검 보고서를 생성해 나빅에 저장함으로써 누구나 활용할 수 있는 고품질 데이터로 정리된다.
- 헤더 정보: 염기서열 해독 기기, 연번, 유전 정보 구성 형식, 구분용 염기서열 등
농촌진흥청은 외부 공개에 앞서 내부 부서를 중심으로 기술을 활용하고 있다. 이를 바탕으로 실제 업무 환경에서 기술의 안정성과 실효성을 면밀히 검토하고, 정밀도를 높이는 연구를 진행하고 있다. 외부 연구 현장에는 서버 등의 추가 기반 시설이 확보되는 2028년부터 활용할 수 있을 것으로 예상한다.
농촌진흥청 슈퍼컴퓨팅센터 이태호 센터장은 “농촌진흥청 슈퍼컴퓨터 2호기와 인공지능 기술을 융합한 데이터 품질관리 자동화 체계는 연구 효율을 높이는 데 중점을 둔 기술”이라며, “연구자들이 데이터 품질 검증에 쓰던 시간을 연구개발에 투입할 수 있어 연구 효율을 크게 높일 수 있을 것으로 기대된다.”라고 말했다.
붙임 1. 농생명 연구 자료 품질관리 자동화 기술 개발
- 농생명 원시 자료 유형별 정량적 품질 검증 기준
담당 부서
국립농업과학원
책임자
센터장
이태호
(063-238-4558)
슈퍼컴퓨팅센터
담당자
연구사
정황원
(063-238-4661)
붙임 1
농생명 연구 자료 정량 품질관리 자동화 기술 개발
□ 품질 검증 프로세스 개선 필요성
○ 기존 방식의 문제점
- 실제 과학적 분석에 활용 가능한지 판단하는 '내용 검증' 단계(염기서열 품질 분석, 서열 정합성, 유효 데이터 감정 등)를 고도로 훈련된 관리자가 일일이 수작업으로 검증을 수행해 옴
- 전문가 섭외나 검증을 한 것을 재검증해야하는 등 많은 시간과 노력이 필요
- 최근 데이터양 급증에 따라 이 ‘내용 검증’ 단계가 전체 연구 흐름을 가로막는 병목 지점으로 지목되어 많은 개선 노력이 집중되고 있음
AI 기반 빅데이터 관리 체계
□ 인공지능(AI) 기반 품질 자동화
○ 1단계: 전처리
- 기탁자가 플랫폼에 대용량 오믹스 데이터를 업로드하면 초고성능컴퓨터로 보내어 자동 전처리를 수행함
○ 2단계: AI가 파일형식을 검증(표준화)
- 원시 데이터 내부에 표기된 특성 정보(염기서열 해독 기기, 연번, 유전 정보 구성 형식, 구분용 염기서열)를 자동으로 추출하여 샘플 ID, 실험 날짜, 염기서열 고유 데이터 등을 분류함
○ 3단계: AI가 사전 설정된 기준에 따라 내용을 검토
- 염기서열* 자체의 논리적 정합성및 분석 규격 범위 유효성을 계산함
- DNA나 RNA의 해석을 위해 작은 화학 물질 단위로 구분한 문자열(A, T G, C)
-
유전체, 전사체 등 개별 데이터 유형 특성에 따라 미리 확립된 정량적 품질 기준(품질 점수, 서열 길이, 매핑률 등)에 따라 오류를 추적․자동 채점함
-
추출된 메타 정보 속의 생물 종 명칭 등을 국제 표준 분류 체계(NCBI Taxonomy) 정보에 따라 데이터 기재 표준화 시킴
○ 4단계: 보고서 자동 생성 및 최종 검수
-
품질 평가 결과 수치를 바탕으로, 최종 품질 점검 보고서를 자동 생성
-
검증 규격을 최종 통과한 무결점 고품질 데이터는 승인 프로세스를 즉각 통과하여 NABIC에 등록 및 저장
붙임 2
농생명 원시 자료 유형별 정량적 품질 검증 기준
□ 유전체(Genome) 자동 검증 기준
○ 염기서열 길이(Read Length)
- 수집된 유전 정보의 양이 충분한지, 정해진 규격에 맞게 읽혔는지 자동으로 확인하여 신뢰도를 확보함
○ 평균 품질 점수(Average Quality Score)
- 시퀀싱 기기가 염기서열을 읽을 때 발생하는 에러를 제어하기 위해, 정확도 점수(Quality score)가 28점 이상인 데이터만 '정상'으로 판정함
○ GC 함량 비율(GC Content)
- 생물체마다 가진 염기서열 특성을 확인하기 위해, 특정 성분(GC)의 비율이 정상 범위(40~60%) 내에 있는지 계산함
□ 전사체(Transcriptome) 자동 검증 기준
○ 유효 정렬률(Mapping Rate)
- 잘게 쪼개진 전사체 서열 조각들이 표준 참조 유전체와 비교해 일치하는지 파악함(매핑 비율 최소 80% 이상)
○ 시퀀싱 중복률(Duplication Rate)
- 실험 과정에서 실수로 똑같이 복제된 불필요한 정보(중복 서열) 걸러내고 유효 발현량만 특정하기 위해 중복 비율을 20% 이하로 제한함
○ 방향 특이성(Strand Specificity)
- 유전 정보가 정해진 방향대로 정확하게 읽혔는지 확인하며, 정밀 측정할 수 있도록 방향 특이성(Strand specificity)이 90% 이상인지 확인함
□ 자동화 인공지능(AI) 알고리즘
○ 다중판단(Ensemble) 기반 머신러닝 분류 알고리즘 적용
- 하나의 기준이 아닌, 여러 개의 판단 기준을 근거로 판단해 구조 결정에 뛰어난 성능을 보이는 'Random Forest 분류 알고리즘'을 적용함
○ AI가 데이터를 구별할 수 있도록 아래의 핵심 정보들을 학습
*서열 길이, GC 함량 비율 헤더 키워드 및 식별자 존재 여부, QC 통계값
출처
문의처
담당부서
농촌진흥청
