DeepMind SynthID Bio: 워터마크가 단백질 물질까지 검증된다
생성형 AI가 단백질 구조 예측(AlphaFold)을 넘어 새 단백질 설계(AlphaProteo, ProteinMPNN), 박테리오파지 게놈 설계(Evo 2)까지 담당하게 되면서, 정작 검증 쪽이 빈손으로 남았다. AI가 만든 염기서열은 자연 서열과 닮지 않아 기존 DNA 합성 스크리닝을 우회할 수 있고, 잘못 라벨된 합성 구조는 공개 데이터베이스를 오염시킨다. Google DeepMind가 9월 30일 공개한 SynthID Bio는 이 간극을 노린 합성생물학 전용 워터마킹 기법 모음이다. 디지털 모델에서뿐 아니라 합성된 물리적 단백질 자체에서 서명을 검증할 수 있으면서 실험실에서 생물학적 기능을 유지한다는 점이 기존 SynthID(텍스트·이미지·비디오) 계열과 다르다. (이 글의 초안은 설치된 Hermes 에이전트가 작성했고, Claude가 검수 후 발행했다.)
TL;DR: SynthID Bio는 데이터 유형별로 방식을 바꿔 워터마크를 심는다 — 서열에는 아미노산 선택을 은밀히 유도하고, 예측 3D 구조에는 원자 좌표를 조정한다. AlphaProteo+SynthID Bio 버전 ProteinMPNN으로 만든 워터마크 단백질 결합체가 VEGF-A, SARS-CoV-2 스파이크 RBD, PD-L1 3개 표적에서 wet-lab 검증을 통과했고, AlphaFold 3 확산 네트워크 일부를 파인튜닝해 모델 가중치에 검증 능력을 심어 예측 정확도를 유지하면서 거의 완벽한 검출률을 냈다. 방법론 논문 공개와 함께 코드·in vitro 데이터·가중치를 오픈소싱했다. 당장의 실무 적용보다는 “AI 생성 생물 데이터의 출처 추적”이라는 인프라의 첫 단계에 가깝다.
1. 왜 단백질에 워터마크인가
기존 DNA 합성 스크리닝은 주문서를 알려진 위협 데이터베이스와 대조한다. 낯선 서열이면 “아직 발견되지 않은 자연 생물”로 안전하게 가정해 왔다. 그런데 AI가 알려진 위험과 거의 닮지 않은 완전히 새로운 서열을 만들어내면서 이 가정이 무너졌다. 낯선 주문이 설계된 위협인지 확인하려면 수작업 정밀 검토가 필요하고, 이것이 연구 병목이 된다.
SynthID Bio는 이 지점에서 자동 검증 신호를 제공한다. 주문이 안전장치가 내장된 신뢰할 수 있는 모델에서 나왔음을 증명해, 스크리너는 자원을 정밀 검토가 필요한 서열에 집중할 수 있다.
공개 데이터베이스 쪽 문제도 뿌리가 같다. Protein Data Bank, UniProt, GenBank 같은 데이터베이스 중 상당수는 공개 제출을 받는데, 잘못 라벨된 항목은 바이오시큐리티 의사결정에 불균형하게 큰 악영향을 줄 수 있다. AI 생성 데이터가 더 들어오면 이 문제는 커진다. 원문은 SynthID Bio가 제출 과정에서 합성 항목에 올바른 라벨을 붙이거나 추가 검토 대상으로 표시하는 데 도움이 될 수 있다고 본다.
2. 동작 원리: 데이터 유형별로 방식을 바꾼다
SynthID Bio는 하나의 방법이 아니라 합성생물학용 워터마킹 기법 모음(family of methods)이고, 데이터 유형에 따라 접근을 바꾼다.
- 단백질 서열: 아미노산 선택을 은밀히 유도(subtly guiding the choice of amino acids)해 검출 가능한 신호를 만든다.
- 예측 3D 구조: 원자 좌표를 조정해 신호를 심는다.
실험실 테스트에서 단백질의 생물학적 기능은 유지됐다. 워터마크의 핵심 제약이 기능 보존이라는 뜻이다.
원문 근거
"SynthID Bio embeds an imperceptible signature directly into the biological code, ensuring the watermark is verifiable not just on a digital model but on the synthesized, physical protein itself – all while preserving its biological function in laboratory testing."
"It adapts its approach depending on the type of data, subtly guiding the choice of amino acids for sequences and adjusting atomic coordinates for predicted 3D structures, creating a reliable signal for detection."
3. 결합체 설계 검증: wet-lab 통과
검증 대상은 단백질 결합체(protein binder), 즉 다른 단백질에 선택적으로 달라붙도록 설계된 분자다. DeepMind는 자체 결합체 설계 방법인 AlphaProteo와, 널리 쓰이는 단백질 서열 생성 방법 ProteinMPNN의 SynthID Bio 활성화 버전을 함께 썼다.
Wet-lab 결과가 이 글에서 가장 실질적인 부분이다. 세 표적 단백질(VEGF-A, SARS-CoV-2 스파이크 단백질 RBD, PD-L1)에서 워터마크 설계는 워터마크가 없는 버전과 hit rate, 결합 친화력(binding affinity), 자연 서열 다양성이 같은 수준이었다. DeepMind는 이를 최초의 워터마크가 들어간, 생물학적으로 기능하는 단백질 결합체라고 설명한다. 본문에는 “맞췄다”는 서술만 있고 수치는 그래프로 제시되므로, 구체적인 값이 필요하면 방법론 논문을 봐야 한다.
원문 근거
"In wet-lab testing across three target proteins (VEGF-A, the SARS-CoV-2 spike protein RBD, and PD-L1), our watermarked designs matched the hit rate, binding affinity, and natural sequence diversity of unwatermarked versions, successfully creating the first-ever watermarked and biologically functional protein binders."
4. 단백질 폴딩: 모델 가중치에 심는 방식
폴딩 쪽 접근이 구조적으로 더 흥미롭다. SynthID Bio는 AlphaFold 3의 확산 네트워크 일부를 파인튜닝해 워터마크 능력을 모델 가중치에 직접 심는다. 원문 표현으로는 예측된 3D 좌표가 누가 모델을 돌리든 검출 가능한 서명을 본질적으로 갖는다.
원문이 주장하는 특성은 세 가지다.
- AlphaFold 3 예측 정확도를 유지하면서 거의 완벽한 검출률(near-perfect detectability) 제공
- 핵심 구조적 특징 분포 유지
- 디지털 노이즈나 미세 좌표 변화에 대한 견고성
가중치에 심는 방식은 사후(post-hoc) 워터마킹과 다르다. 출력물에 나중에 도장을 찍는 게 아니라 모델이 서명을 담은 좌표를 직접 만들어낸다. 다만 다음 절에서 볼 것처럼 의도적 변조에 대한 견고성은 여전히 열린 과제다.
원문 근거
"SynthID Bio preserves AlphaFold 3 prediction accuracy while offering near-perfect detectability, maintaining key structural feature distributions, and holding up against digital noise or minor coordinate changes."
5. 배치: Swiss cheese 방어의 한 층
원문은 바이오시큐리티를 Swiss cheese 방어 모델로 설명한다. 여러 독립 안전장치가 서로의 사각지대를 덮는 구조이고, 모델 수준 완화 조치나 고객 심사도 각각 빈틈 있는 층이다. SynthID Bio는 그 구조에서 생물학적 설계 자체에 박힌 검증 층의 역할을 한다.
외부 전문가 코멘트 두 개가 원문에 실려 있다.
- Sarah Carter(바이오시큐리티 정책 전문가, Science Policy Consulting Principal, 이 작업 검토): SynthID Bio를 생물학적 설계의 출처 추적을 위한 퍼즐의 중요한 조각이라고 평가했다. 설계를 모델 개발자와 연결하면 개발자가 안전을 주도하고, 합성 제공자는 해당 모델을 쓴 고객의 스크리닝을 간소화할 수 있다는 것이다.
- James Diggans(Twist Bioscience 정책·바이오시큐리티 VP, 논문 조기 피드백 제공): 워터마킹은 바이오시큐리티 도구 상자에 들어갈 유망한 추가 요소이며, 스크리닝을 강화하고 자원을 면밀한 검토가 필요한 서열에 집중시킬 수 있다고 봤다.
DNA 합성 제공자 입장에서 워터마크의 실용성이 이 코멘트에 요약돼 있다. 검증 신호가 있으면 신뢰 모델 출신 주문은 자동 통과시키고 사람 검토는 예외에만 쓰는 식의 운영이 가능해진다.
원문 근거
"By linking designs to the model developer, these watermarks empower developers to lead on safety and allow synthesis providers to streamline screening for customers who have used those models."
6. 열린 과제와 다음 단계
원문이 밝히는 한계와 앞으로의 계획은 다음과 같다.
- 의도적 변조 견고성: 원문은 어떤 단일 바이오시큐리티 개입도 만능이 아니라고 인정하고, 의도적 조작에 대한 견고성 강화를 핵심 과제로 든다. 앞서 본 검출 성능은 디지털 노이즈나 미세한 좌표 변화에 대한 것이지, 적대적 제거 시도에 대한 방어력으로 읽어서는 안 된다.
- 출처 메타데이터 병행: 디지털 미디어의 C2PA와 비슷한 출처(provenance) 메타데이터 접근, 또는 AI 생성 생물 데이터의 중앙 저장소와 함께 쓰는 방안을 제시한다. 워터마크를 출처 추적의 유일한 수단이 아니라 신호 중 하나로 두겠다는 방향이다.
- 더 복잡한 생물 대상: Stanford 대학과 Arc Institute의 Hie lab과 진행 중인 협업으로 Evo 2 게놈 모델에 SynthID Bio를 통합해, Evo 2가 설계한 박테리오파지 게놈에 워터마크를 심었다. 세균 배양 초기 실험실 테스트에서 이 박테리오파지가 기능한다는 점이 확인됐고, 기술 논문은 곧 공개될 예정이다.
- 오픈소싱: 방법론 논문을 공개하고, 코드와 in vitro 데이터를 오픈소스로 내놓으며 가중치도 연구 커뮤니티에 공개한다고 밝혔다.
7. 실무 관점: LLM 쪽에서 가져갈 것
바이오 분야 발표지만, 워터마크 설계 방식은 생성형 AI의 출처 추적을 고민하는 개발 환경에도 참고가 된다. 아래는 원문이 아니라 글쓴이의 해석이다.
- 가중치 내장형 서명의 일반화 가능성: AlphaFold 3 확산 네트워크 일부를 파인튜닝해 서명을 심는 방식은, 텍스트/이미지 생성 모델에서 디코더 가중치에 출처 신호를 심는 연구 방향과 같은 계열이다. 사후 방식과 비교하면 모델을 다시 학습해야 하고 다운스트림 파인튜닝에서 서명이 살아남는지 따져야 한다는 부담이 따라올 것으로 보인다.
- 기능 보존 = 품질 보존: 바이오에서 “워터마크가 생물학적 기능을 해치지 않는다”는 제약은, 언어 모델 워터마크에서 “퍼플렉시티·벤치마크 점수를 해치지 않는다”는 제약과 같은 위치다. SynthID Bio의 wet-lab 검증은 이 제약을 실험실까지 가져간 것이라 평가 방법으로 참고할 만하다.
- 레이어드 방어 프레임: 단일 기법을 만능으로 쓰지 않고 여러 층으로 조합한다는 Swiss cheese 모델은 LLM 가드레일 설계에서도 같은 결론에 닿는다. 입력 필터, 출력 필터, 출처 워터마크, 감사 로그가 각자 빈틈을 덮는 구조다.
- 한국어 LLM/RAG 환경과의 접점: 당장의 개발 환경에는 직접 적용 대상이 없다. 다만 AI 생성 콘텐츠 출처 표기가 규제·플랫폼 정책으로 확산되는 흐름에서, C2PA류 메타데이터와 생성 모델 내장 서명을 어떻게 조합할지는 RAG 파이프라인의 콘텐츠 출처 설계에도 참고가 된다.
8. 관련 글
- 관련 글: Claude가 생체분자 모델 30개를 4배 빠르게 만든 4주 — 생체분자 모델링 워크로드 최적화
- 관련 글: Claude-shaped science: AI 과학 연구 패턴 분석 — Anthropic의 AI for science 접근
- 관련 글: 모델 아래층을 누가 고치고 있나 — Hugging Face × OS4Science Fund — 과학용 오픈소스 모델 유지보수
- 원문: Introducing SynthID Bio
- 관련 선행 기법: SynthID (텍스트·이미지·비디오 워터마킹)
- 연관 기반 모델: AlphaFold: Five years of impact, AlphaProteo
- 타이틀 사진: Unsplash