예측이 심판을 맡길 수 있을 만큼 정확해졌습니다
블라인드 평가 CASP14에서 알파폴드2는 주쇄를 탄소 원자 폭 수준으로 맞혔습니다. 차점 방법은 2.8 Å였습니다. 공개 데이터베이스에는 2억 1,400만 개 서열의 구조가 들어 있습니다. 그 전 반세기 동안 실험으로 푼 구조는 약 10만 개였습니다.
Jumper 외, Nature, 2021 ↗단백질 설계
단백질은 프로그래밍할 수 있는 기계입니다. 구조와 서열과 기능을 읽는 모델을 만들고, 그 모델로 새로운 것을 씁니다.
적용
안정성과 생산성 제약 안에서 서열과 구조를 설계합니다.
결합체 생성, 친화도 개선, 개발 가능성 평가를 하나의 목표로 묶습니다.
활성과 안정성, 특이성을 실제 공정 조건에 맞춰 함께 최적화합니다.
구조가 밝혀진 에피토프를 겨냥해 처음부터 새로 설계합니다.
이미 동작하는 단백질을 공정이 실제로 필요로 하는 축으로 밀어 올립니다.
가까운 자연 친척이 없는 영역을 탐색합니다.
예측하는 단계를 넘어 설계하는 단계로.
방법
만들고 나서 거르는 대신 조건을 걸고 생성합니다. 제약이 이미 배제한 영역에 계산을 낭비하지 않습니다.
학습 스코어가 순위를 매기고, 순위로 가릴 수 없는 다툼은 시뮬레이션이 판정합니다.
적중률과 실패 양상, 그리고 작동하지 않은 설계까지가 결과입니다.
왜 AI인가
구조 예측 모델과 단백질 언어 모델은 진화의 기록 전체로 학습합니다. 그래서 어떤 아미노산 패턴이 실제로 접히고 기능하는지를 흡수합니다. 진화가 실제로 걸어온 길이 아니라 걸을 수 있었던 길의 공간에서 움직입니다.
사람은 이미 가진 단백질을 변이시킵니다. 생성 모델은 표적 표면이나 활성 부위, 원하는 접힘을 조건으로 새 골격을 뽑습니다. 한 번에 서열 공간을 크게 건너뜁니다.
예측이 정확해지자 설계 수백만 개를 계산으로 먼저 걸러 그럴듯한 소수만 실제로 만들 수 있게 됐습니다. 대표적인 연구는 100배의 성공률 향상 중 절반은 생성 모델, 절반은 실험 전 필터링 덕이라고 밝혔습니다.
2024년 노벨 화학상은 계산 단백질 설계로 데이비드 베이커에게, 단백질 구조 예측으로 데미스 허사비스와 존 점퍼에게 돌아갔습니다.
근거
설계는 모델에서 나왔고 단백질은 플라스크에서 나온, 동료심사를 거친 결과들입니다.
블라인드 평가 CASP14에서 알파폴드2는 주쇄를 탄소 원자 폭 수준으로 맞혔습니다. 차점 방법은 2.8 Å였습니다. 공개 데이터베이스에는 2억 1,400만 개 서열의 구조가 들어 있습니다. 그 전 반세기 동안 실험으로 푼 구조는 약 10만 개였습니다.
Jumper 외, Nature, 2021 ↗구조 예측 모델을 거꾸로 돌려 설계 엔진으로 쓰자, CRISPR-Cas9을 포함한 까다로운 타깃 12개에서 대량 스크리닝 없이 실험으로 확인된 결합체가 나왔습니다. 같은 논문은 이전의 물리 기반 방식을 0.1% 미만으로 적었습니다.
Pacesa 외, Nature, 2025 ↗의학적으로 의미 있는 타깃 다섯 개에 붙는 단백질을 만들라고 했더니, 타깃당 100개 미만의 설계로 성공했습니다. 이전 방식은 수천 개를 시험해야 했습니다. 설계된 MDM2 결합체는 0.5 nM에 도달해, 대체 대상인 천연 펩타이드보다 약 1,000배 강하게 붙었습니다.
Watson 외, Nature, 2023 ↗단백질 언어 모델에 빛나는 것을 만들라고 했더니, 알려진 형광 단백질 중 가장 가까운 것과 58%, 해파리 GFP와는 36%만 같은 서열의 초록 형광 단백질이 나왔습니다. 저자들은 그 거리를 자연 진화로 5억 년 이상이라고 추정합니다.
Hayes 외, Science, 2025 ↗새로 만들어 낸 접힘 안에 설계한 발광 효소는 빛을 내고, 95도에서도 버티며, 촉매 효율은 천연 효소와 맞먹으면서 기질 선택성은 훨씬 높습니다.
Yeh 외, Nature, 2023 ↗반대쪽 절반도 그대로 적습니다. 그 발광 효소의 1차 시도는 7,648개 설계 중 3개만 작동했습니다. 가장 좋은 결합체 파이프라인도 제일 어려운 타깃에서는 열에 아홉이 실패합니다. 병목은 연산이 아니라 여전히 실험입니다. 위의 모든 결과는 대장균에서 발현시켜 실제 장비로 측정하는 것으로 끝납니다.