| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 한국산업경영시스템학회
- AAAI
- 지니계수
- BDA
- adaboost
- 에이다부스트
- 로짓
- distillm
- 데이터사이언스
- dl
- BDA학회
- Machine Learning
- 엔트로피
- ML
- 빅데이터분석학회
- DT
- 머신러닝
- 평가지표
- confusion_matrix
- skld
- 가지치기
- AutoML
- OLS
- 의사결정트리
- 랜덤포레스트
- 부스팅
- 로지스틱
- 논문리뷰
- 규제
- 선형회귀
- Today
- Total
데이터 사이언스 공부할래
[AlphaFold2] Highly accurate protein structure prediction with AlphaFold 본문
[AlphaFold2] Highly accurate protein structure prediction with AlphaFold
SeonHo Yoo 2025. 8. 7. 22:20단백질 구조는 생명 현상 이해에 필수적
실험적으로 규명된 구조(약 10만 개)는 알려진 서열(수십억 개)의 극히 일부에 불과함
단백질 접힘 문제(protein folding problem)는 50년 이상 해결되지 않은 과제였으며, 기존 방법들은 상동 구조가 없을 때 정확도가 낮음
AlphaFold는 유사 구조가 없는 경우에도 원자 수준의 정확도로 단백질 구조를 예측할 수 있는 최초의 계산 방법으로, CASP14에서 다른 방법들을 크게 능가
이 모델은 물리·생물학적 지식을 딥러닝에 통합하고 다중 서열 정렬(MSA)을 활용하는 혁신적 접근법을 기반으로 한다.
단백질 3차원(3D) 구조를 단백질 서열로부터 예측하는 계산적 방법의 발전은 물리적 상호작용과 진화적 이력 가운데 어느 쪽을 중점적으로 다루느냐에 따라 두 갈래로 전개되어 왔다.
가까운 상동 구조가 실험적으로 알려지지 않은 경우에는 두 접근 모두 실험 수준에는 훨씬 못 미치는 정확도를 내며, 이 때문에 다양한 생물학적 응용에서 활용이 제한되었다.
본 연구는 대부분의 경우에서 실험과 근접한 정확도로 단백질 구조를 예측할 수 있는 계산적 방법을 제시한다.

그림 1 | AlphaFold가 생성한 구조
a. CASP14 데이터셋(단백질 도메인 87개)에서 AlphaFold의 성능을 평가하여, 전체 146개 제출물 중 상위 15개 팀과 비교 결과.
b. CASP14 타깃 T1049(PDB ID: 6Y4F)에 대한 AlphaFold 예측 구조(파란색)와 실제 결정 구조(녹색)의 비교. 결정 구조의 C-말단에 있는 네 개 잔기는 B-팩터 이상치라 판단되어 그림에서 생략하였다.
c. CASP14 타깃 T1056(PDB ID: 6YJ1).
d. CASP 타깃 T1044(PDB 6VR4)—잔기 수가 2,180개에 이르는 단일 사슬 단백질—도 AlphaFold(사후 CASP, 추가 조정 없이 실행)로 예측했을 때 도메인 간 배치가 올바르게 맞았다.
e. 모델 아키텍처 도식. 화살표는 본문에서 설명한 여러 구성 요소 간 정보 흐름을 나타내며, 배열의 모양은 괄호 안에 표기했다. 여기서 s는 서열 수, r은 잔기(각 아미노산이 차지하는 한 자리) 수, c는 채널 수를 의미한다.
AlphaFold 네트워크
- MSA(다중 서열 정렬)와 잔기-쌍(pairwise) 특징을 공동 임베딩하는 새로운 아키텍처,
- 3D 구조를 끝까지(end-to-end) 직접 예측할 수 있는 출력 표현과 손실 함수,
- 등변(equivariant) 어텐션 블록
- 중간 단계 손실을 활용한 반복적 정제(iterative refinement),
- 구조 예측과 동시에 학습되는 마스크드 MSA 손실,
- 자기 지식 증류(self-distillation)를 통한 비라벨 단백질 서열 학습,
- 모델의 자체 신뢰도 추정 등이 핵심이다.
AlphaFold 네트워크는 주어진 아미노산 1차 서열과 상동 서열이 포함된 MSA를 입력으로 받아, 모든 무거운 원자(heavy atom)의 3D 좌표를 직접 출력한다.
두 단계 네트워크
- Evoformer
- 입력을 반복적으로 처리하는 Evoformer 블록을 거치며
- 크기 N_seq × N_res (서열 수 × 잔기 수)의 MSA 표현
- 크기 N_res × N_res 의 잔기-쌍 표현 생성
- MSA 표현은 원시 MSA로 초기화되며, 어텐션 기반·비어텐션 기반 모듈들이 포함된다.
- MSA ↔ 잔기-쌍 간 정보를 주고받는 새로운 메커니즘이 핵심 혁신으로, 공간·진화 관계를 직접 추론할 수 있게 한다.
- 구조적 가설이 Evoformer 초기에 형성된 뒤 지속적으로 정제
- 입력을 반복적으로 처리하는 Evoformer 블록을 거치며
- Structure module
- 각 잔기에 대해 회전·병진을 명시적으로 도입해 3D 구조를 구성
- 초기 상태는 모든 회전을 단위행렬, 위치를 원점으로 두지만, 고해상도 구조를 생성·정제
- 사슬을 임시로 끊어 전 영역을 동시에 국소 정제하고, equivariant transformer로 표현되지 않은 측쇄까지 추론
- 잔기의 방향 정확성에 큰 가중치를 두는 손실 항도 도입
반복적 정제(recycling)
- Structure Module 출력에 최종 손실을 적용한 뒤, 그 출력을 다시 네트워크에 재투입하는 방식을 여러 차례 반복한다.
- 훈련 시간을 늘리지 않으면서 예측 정확도를 크게 끌어올렸다.

a. 3,144개 단백질 사슬에서 평균적인 오차가 탄소 원자 직경(≈1.4 Å)에 근접
b. 대체로 lDDT-Cα(5,317개 사슬에서 백본 정확도)가 90을 넘어가면 측쇄도 실험 수준에 근접함
c. 10,795개 사슬에 대해 모델이 출력한 pLDDT(모델이 스스로 매긴 점수)와 실제 lDDT-Cα를 비교. pLDDT가 지역 정확도를 신뢰성 있게 예측함
d. 동일한 사슬 집합에서 전역 접합 지표인 TM-score와 pTM(모델의 추정치)을 대조, 높은 상관을 보여, 모델이 전체 도메인 배치 정확도 역시 정밀하게 추정할 수 있음
- Evoformer 블록 작동 방식
- 단백질 구조 예측을 3차원 그래프 문제로 접근
- 그래프에서 간선은 가까운 아미노산 잔기들을 연결
- pair 표현은 두 잔기 사이의 관계를 나타냄
- MSA 표현은 원본 서열과 상동 서열 정보를 담음
- 정보 흐름과 업데이트
- MSA 표현에서 요소별 외적을 계산해 pair 표현에 정보 전달
- 모든 블록마다 이 과정을 반복해 MSA 정보가 지속적으로 반영
- pair 표현 내에서는 두 가지 업데이트 방식 작동
- **삼각형 패턴(3c)**을 활용한 연산
- 축별 어텐션에 '빠진 변'에 대한 로짓 편향 추가
- 삼각 곱셈 업데이트로 두 변의 정보로 나머지 변 계산
- MSA 표현에 변형된 어텐션 사용
- 어텐션 계산 시 pair 표현 정보 추가로 MSA 어텐션에 방향성 부여
- pair→MSA로 정보가 순환되어 두 표현을 효과적으로 통합
- 최종적으로 구조 모듈에 통합된 정보 전달

그림 3 | AlphaFold 아키텍처
- a. Evoformer 블록
- 각 블록 내부에서 정보가 흐르는 경로, 괄호 안 숫자는 배열의 모양
- b. Pair 표현의 그래프 해석
- 잔기(residue)들을 꼭짓점으로, 잔기 i와 j 사이의 방향성 있는 간선을 pair 행렬으로 표현
- c. 삼각 곱셈 업데이트 & 삼각 어텐션
- 세 잔기가 이루는 삼각형 중 두 개의 간선 정보를 조합하거나 어텐션 편향을 더해 나머지 간선을 일관성 있게 추론·보정한다는 개념
- d. Structure 모듈과 Invariant Point Attention(IPA)‘Single representation’은 MSA 표현의 원본 서열을 복사한 것으로, IPA 블록에서 백본·측쇄 원자 위치를 세밀히 조정할 때 기준 좌표로 사용
- 구조 모듈은 Evoformer가 만든 표현을 받아 각 잔기에 대해 회전·병진을 예측
- e. Residue Gas 표현
- 각 잔기를 자유롭게 떠 있는 하나의 강체(backbone rigid body·파란 삼각형)로 두고, 측쇄의 각도를 별도 자유도로 둔 추상적 모델
- f. FAPE(Frame Aligned Point Error) 손실
- 초록색은 예측 구조, 회색은 정답 구조. FAPE는 각 원자를 해당 잔기의 프레임에 정렬한 뒤 두 구조 간 거리를 재어 방향성과 입체화학까지 올바르게 맞추도록 학습
End-to-End 구조 예측
- 구조 모듈 작동 원리
- 두 가지 입력 활용
- 페어(pair) 표현
- MSA 표현의 첫 행(원본 서열; single representation)
- Residue Gas 표현
- 각 잔기는 전역 좌표계에서 독립적인 회전·병진으로 표현
- N–Cα–C 원자의 기하를 우선 보존
- 프레임 내부에서 측쇄 위치가 강하게 제약됨
- 구조 최적화 과정
- 펩타이드 결합 제약을 완화하여 전체 미세 조정
- 위반 손실(violation loss)로 결합 기하 유도
- Amber 힘장으로 최종 에너지 최소화 수행
- 두 가지 입력 활용
- 구조 갱신 과정
- IPA (Invariant Point Attention)
- 좌표를 고정한 채 단일 표현 업데이트
- 강한 공간 편향을 반영
- 등변(equivariant) 업데이트
- 각 잔기의 회전·병진을 실제로 조정
- 구조를 정밀하게 다듬는 역할
- 최종 출력 정보
- 잔기별 측쇄 χ 각
- 국소 신뢰도 pLDDT
- 전역 TM-score 추정치 pTM
- FAPE(Frame-Aligned Point Error) 손실 함수
- 프레임별 정렬 거리 측정
- 국소 기하와 키랄리티까지 정확히 맞추도록 학습
- IPA (Invariant Point Attention)
라벨·비라벨 데이터 병행 학습 (Training with Labelled and Unlabelled Data)
- AlphaFold의 학습 과정 개선
- PDB 구조(라벨 데이터)만으로도 높은 정확도 달성
- **자기 지식 증류(self-distillation)**로 성능 향상
- 학습된 네트워크가 UniClust30의 약 35만 서열 예측
- 신뢰도 높은 구조를 선별하여 PDB 데이터와 혼합
- 처음부터 다시 학습하는 방식 채택
- 데이터 증강 기법 적용
- 크롭·MSA 서브샘플링 등 강한 증강 사용크
- 네트워크가 이전 예측을 그대로 재현하기 어렵게 설계
- 무라벨 서열 정보 효과적으로 활용
- BERT 기반 보조 학습 전략
- MSA에서 임의 잔기를 마스킹/돌연변이시켜 학습
- BERT-형 목표로 복원하도록 공동 학습
- 특정 상관 통계 없이도 계통·공변 정보를 스스로 해석
- 구조 손실과 동일 예시에서 함께 학습
- 별도 사전학습 불필요
신경망 해석 (Interpreting the Neural Network)
- AlphaFold 내부 추론 과정 분석
- 48개 Evoformer 블록마다 별도 구조 모듈 연결(주 가중치 고정)
- 리사이클 단계 포함해 총 192개의 중간 구조 추출
- 초기 몇 블록 이후 예측 궤적이 매끄럽게 수렴
- 네트워크가 구조를 지속적으로 개선하다 더 이상 향상되지 않는 지점에서 멈춤
- 난이도별 구조 예측 차이
- 난이도 높은 경우(예: SARS-CoV-2 ORF8 타깃 T1064)
- 여러 층에 걸쳐 2차 구조를 재배치하며 탐색
- 비교적 쉬운 경우(예: LmrP 타깃 T1024)
- 초기 층에서 이미 최종 구조 발견
- 난이도 높은 경우(예: SARS-CoV-2 ORF8 타깃 T1064)
- 분석 및 시각화
- Supplementary 영상과 어텐션 맵으로 계층적·점진적 구축 과정 시각화
- Figure 4a 및 보충 절에서 다양한 구성 요소의 정확도 기여도 상세 설명

Fig. 4 해석
a. Ablation(구성 요소 제거) 실험 결과
- 두 개의 평가 집합을 사용했다.
- CASP14 도메인 세트 (단백질 도메인 87개) — 평가지표: GDT.
- PDB 테스트 세트 (템플릿 피복 ≤ 30 %, 서열 유사도 30 % 이하인 단백질 사슬 2,261개) — 평가지표: lDDT-Cα.
- 여러 메커니즘(재활용, 삼각 업데이트, FAPE 손실 등)이 모두 정확도에 실질적으로 기여함
b. 네트워크 깊이에 따른 구조 수렴 궤적
- 재활용(recyle) 4 회 × Evoformer 48 블록 진행 과정에서 GDT가 어떻게 개선되는지 시각화
- T1024 (LmrP) 도메인 D1, D2: 네트워크 초반 몇 블록에서 이미 최종 구조(GDT 고정)에 도달
- T1064 (ORF8) 도메인 D1: 2차 구조 배치가 여러 번 바뀌면서 GDT가 계단식으로 상승해, 네트워크 거의 끝에서야 최종 구조에 수렴한다.

Fig. 5
a. MSA 깊이가 예측 정확도에 미치는 영향
PDB 구조들 가운데, 서로 다른 사슬끼리 많이 안 붙는 것을 뽑음
- 강한 템플릿 : 서열 유사도 30 % 기준으로 사슬 길이의 60 % 이상을 덮는 템플릿이 존재하는 경우(6,743 개 사슬)
- 약한 템플릿 : 동일 기준으로 30 % 미만만 덮히는 경우(1,596 개 사슬)
MSA에서 같은 자리에 겹치지 않고 남아 있는 서열이 몇 개인지 세어 Neff로 표현
Neff가 클수록 깊다 = 서열 정보가 풍부하다
결과적으로 MSA가 얕을 때는 템플릿 유무와 관계없이 정확도가 낮지만, 깊이가 증가할수록 두 그룹 모두 급격히 향상
다만 강한 템플릿이 있는 경우가 전 구간에서 약간 더 높은 정확도를 유지
서열 정보량(MSA 깊이)이 충분하면 템플릿 의존도가 크게 줄고, 반대로 MSA가 얕으면 템플릿 존재가 여전히 도움을 준다.
b. 사슬 얽힘(intertwined) 복합체도 단일 사슬 입력으로 예측 가능
예시로 제시한 동종 삼량체(homotrimer) 6SK0는 세 사슬이 서로 깊게 얽혀 있음
AlphaFold는 입력에 복합체의 화학량(stoichiometry)을 명시하지 않고, 서열 하나만 사용했음에도 약한 템플릿만 참고해 전체 얽힌 구조를 정확히 재현
MSA 깊이와 사슬 간 접촉 (MSA depth and cross-chain contacts)
AlphaFold는 PDB에 등록된 대부분의 단백질에서 높은 정확도를 보이지만, MSA(다중 서열 정렬) 깊이와 사슬 간 접촉 패턴에 따라 성능이 달라진다.
- MSA 깊이 영향
- 중앙값 기준 30개 서열보다 얕아지면 정확도가 급격히 떨어짐(Fig. 5a)
- 약 100개를 넘어서면 깊이가 더 늘어나도 이득이 감소하는 '임계 효과' 발생
- 초기 블록에서는 MSA 정보가 필수적이나, 정밀 정제 단계에서는 의존도가 낮을 것으로 추정
- 사슬 간 접촉 패턴 영향
- 이종(heterotypic) 접촉이 많고 동일 사슬·동종 접촉이 적은 단백질에서 정확도가 낮음
- 대형 복합체의 '브리지 도메인'처럼 다른 사슬과의 상호작용으로만 형태가 결정되는 경우 포함
- **동종 복합체(homomer)**는 사슬이 서로 깊게 얽혀 있어도 종종 정확한 예측 가능(Fig. 5b)
- 미래 버전에서는 이종 복합체 전체를 한 번에 예측하도록 확장해 이러한 제한 완화 가능성 있음
Discussion
AlphaFold 설계 철학은 생물정보학적 데이터와 물리·기하 편향을 결합.
- 수소 결합 점수 같은 수작업 특징을 최소화하고, PDB 데이터를 통해 네트워크가 직접 학습하도록 해 적은 데이터로도 높은 표현력을 얻음
- 이 덕분에 물리적 맥락이 결여된 어려운 경우, AlphaFold는 “서열만으로 예측 가능한 화학량·리간드·이온”이 있으면 암묵적으로 그 제약을 만족하는 구조를 내놓는 경향이 있다.
AlphaFold는 이미 실험 구조 결정에도 기여하고 있다.
- 분자 대체법과 저온 전자 현미경 지도 해석에서 보조 모델로 활용되고,
- 예측 속도는 GPU 기준 수 분~수 시간이라, 전체 프로테옴 규모 예측도 실현 가능하다.
결론적으로, AlphaFold는 게놈 혁명으로 폭증한 서열 데이터와, 실험 구조·서열 데이터베이스를 접목해 구조 생물정보학의 속도를 가속할 수 있는 도구