CHO 세포배양 공정을 설명할 때 우리는 대개 배양기 바깥에서 이야기를 시작한다. 온도와 pH, 용존산소, 배지 공급, 생존율과 역가. 그런데 배양기 안에서 실제로 일어나는 일은 세포 하나하나가 유전자를 읽어 단백질을 만드는 것이고, 그 사이에는 "RNA 스플라이싱 (RNA splicing)"이라는 가공 단계가 하나 끼어 있다. 항체 유전자에서 mRNA가 만들어지는 과정에서 어느 부분을 남기고 어느 부분을 잘라 낼지가 이 단계에서 결정된다.
이 단계는 평소에는 보이지 않는다. 그러다 어느 클론에서 목적물보다 크거나 작은 사슬이 섞여 나오고, 역가가 이유 없이 낮게 나오고, 질량분석에서 서열에 없는 아미노산 꼬리가 붙은 경쇄가 잡힐 때 비로소 드러난다. 그때는 이미 세포주 개발이 끝난 뒤인 경우가 많다.
이번 글에서는 RNA 스플라이싱의 기전부터 알아보고, 발현 벡터를 설계할 때 인트론을 넣거나 빼는 이유, 잘못된 스플라이싱이 만들어 내는 제품 변이체, 그리고 이것이 CHO 배양과 품질관리에서 어떻게 드러나는지에 대해 알아보고자 한다.
"항체 유전자를 CHO에 넣을 때 왜 인트론을 일부러 넣기도 할까?" "유전자 서열은 하나인데 왜 목적물과 크기가 다른 사슬이 섞여 나올까?" "이것은 유전자 설계의 문제인가, 배양의 문제인가?" 세포배양이나 세포주 개발을 공부해 본 사람이라면 한 번쯤 가져 봤을 궁금증들이다. 하나씩 차근차근 알아보자.
스플라이싱이 필요한 이유
진핵세포의 유전자는 단백질 서열이 한 줄로 이어져 있지 않다. 성숙 mRNA에 남는 구간인 "엑손 (exon)" 사이사이에 잘려 나가는 구간인 "인트론 (intron)"이 끼어 있고, 인트론이 엑손보다 훨씬 긴 경우도 흔하다. 엑손이라고 해서 전부 아미노산으로 번역되는 것은 아니며, 양 끝의 비번역 구간도 엑손에 속한다. 사람의 유전자 하나에서 인트론이 차지하는 길이는 수 kb에서 수십 kb에 이른다.
RNA 중합효소는 이 구조를 구분하지 않고 유전자 전체를 그대로 읽어 낸다. 그렇게 만들어진 것이 "전구 mRNA (pre-mRNA)"다. 여기에는 엑손과 인트론이 모두 들어 있으므로, 이 상태로 번역하면 인트론이 그대로 아미노산으로 번역되거나 인트론 안의 종결코돈에서 번역이 멈춘다. 어느 쪽이든 온전한 단백질은 나오지 않는다.
그래서 인트론을 잘라 내고 엑손끼리 이어 붙이는 가공이 필요하다. 이것이 스플라이싱이다. 스플라이싱을 마친 RNA가 성숙 mRNA이고, 핵을 빠져나가 리보솜에서 단백질로 번역되는 것은 이 성숙 mRNA다.
여기서 중요한 것은 스플라이싱이 전사가 끝난 뒤에 따로 일어나는 별개의 공정이 아니라는 점이다. 스플라이싱은 전사와 동시에 진행되며, RNA 중합효소가 얼마나 빨리 이동하는지가 스플라이싱의 효율과 스플라이스 부위의 선택에 직접 영향을 준다. 전사와 가공이 같은 자리에서 맞물려 돌아간다는 사실이 뒤에 나올 배양 조건 이야기의 출발점이 된다.
그림 1. 전사에서 성숙 mRNA까지의 과정
스플라이싱의 기전
스플라이스 부위의 신호
인트론을 잘라 내려면 어디가 인트론의 시작이고 어디가 끝인지를 알아야 한다. 그 표시가 RNA 서열 안에 들어 있다.
인트론의 시작 지점을 "5′ 스플라이스 부위 (5′ splice site)"라 하고, 여기는 거의 예외 없이 GU로 시작한다. 사람의 인트론 가운데 GU로 시작하지 않는 것은 1%가 채 되지 않는다. 인트론의 끝 지점은 "3′ 스플라이스 부위"이며, 피리미딘 염기 하나에 이어지는 AG로 끝난다. 그리고 3′ 스플라이스 부위에서 18~40 염기 위쪽에 "분기점 (branch point)"이라 불리는 아데노신이 하나 있고, 분기점과 3′ 스플라이스 부위 사이에는 피리미딘이 몰려 있는 "폴리피리미딘 구간"이 있다.
Table 1. 스플라이스 부위를 알려 주는 신호
| 신호 | 위치 | 서열 | 인식하는 것 |
| 5′ 스플라이스 부위 | 인트론의 시작 | GU로 시작 | U1 snRNP |
| 분기점 아데노신 | 3′ 스플라이스 부위에서 18~40 염기 위 | 보존된 서열 안의 A | U2 snRNP |
| 폴리피리미딘 구간 | 분기점과 3′ 부위 사이 | 피리미딘(C, U)이 몰린 구간 | U2AF의 큰 소단위 |
| 3′ 스플라이스 부위 | 인트론의 끝 | 피리미딘 + AG | U2AF의 작은 소단위 |
신호를 이렇게 정리해 놓고 보면 한 가지가 눈에 띈다. 신호가 너무 짧다는 것이다. GU와 AG는 각각 염기 두 개에 불과하다.
예제) 무작위 염기 서열에서 GU라는 두 염기 조합이 나올 확률은 얼마이고, 1,400 염기 길이의 항체 중쇄 코딩 서열 안에는 GU가 평균 몇 번 나오는가?
염기는 네 종류이므로 특정 염기가 나올 확률은 1/4이고, 두 개가 연달아 특정 조합으로 나올 확률은 1/4 × 1/4 = 1/16, 즉 6.25%다. 1,400 염기 서열에는 이웃한 두 염기의 조합이 1,399개 있으므로 GU는 평균 1,399 ÷ 16 ≒ 87번 나온다. AG도 마찬가지로 약 87번 나온다. 즉 하나의 항체 유전자 안에 5′ 스플라이스 부위처럼 보이는 자리가 이미 수십 개 흩어져 있다는 뜻이다.
그렇다면 세포는 이 87개 중에서 어떻게 진짜 인트론의 경계만 골라내는가. 답은 GU나 AG 하나만 보지 않는다는 것이다. 5′ 부위의 GU 주변 서열, 분기점, 폴리피리미딘 구간, 3′ 부위의 AG가 모두 함께 있어야 스플라이싱 장치가 그 자리를 인트론의 경계로 인정한다. 신호 여러 개의 조합으로 판단하므로 대부분의 GU는 그냥 지나간다.
다만 "대부분"이지 전부는 아니다. 신호가 어중간하게 갖춰진 자리가 있으면 그 자리도 스플라이스 부위로 쓰일 수 있고, 이런 자리를 "잠재 스플라이스 부위 (cryptic splice site)"라고 부른다. 재조합 단백질 생산에서 문제가 되는 이상 스플라이싱의 상당수가 이 잠재 부위에서 비롯된다.
스플라이소좀과 두 번의 반응
스플라이싱을 수행하는 장치를 "스플라이소좀 (spliceosome)"이라고 한다. 다섯 종류의 작은 핵 RNA와 약 100종의 단백질로 이루어진 복합체이며, 반응이 진행되는 동안 구성이 계속 바뀐다.
순서는 이렇다. 먼저 U1 snRNP가 5′ 스플라이스 부위에, U2 snRNP가 분기점 서열에 결합한다. 여기에 U4/U6.U5 삼중 snRNP가 합류하면서 복합체가 재배열되고 반응이 가능한 상태가 된다.
실제 절단과 연결은 두 번의 에스터 전이 반응으로 일어난다. 첫 번째 반응에서는 분기점 아데노신의 2′ 수산기가 5′ 스플라이스 부위의 인산다이에스터 결합을 공격한다. 그 결과 5′ 엑손이 떨어져 나오고, 인트론은 분기점에서 자기 앞부분과 연결되어 올가미 (lariat) 모양이 된다. 두 번째 반응에서는 방금 드러난 5′ 엑손의 3′ 수산기가 3′ 스플라이스 부위를 공격하여 두 엑손이 이어지고 올가미 모양의 인트론이 빠져나온다.
두 반응 모두 새로운 원자를 넣거나 빼는 것이 아니라 결합의 상대를 바꾸는 반응이다. 그래서 스플라이싱은 정확히 같은 위치에서 잘리고 정확히 같은 위치에서 이어져야 한다. 한 염기만 어긋나도 그 뒤의 코돈 읽기틀이 전부 밀린다.
그림 2. 스플라이소좀의 네 단계와 두 번의 에스터 전이 반응
대체 스플라이싱과 항체 유전자
하나의 유전자에서 여러 단백질
스플라이싱이 늘 같은 조합으로 일어나는 것은 아니다. 같은 전구 mRNA에서 어떤 엑손은 포함하고 어떤 엑손은 건너뛰면 서로 다른 단백질이 나온다. 이것이 "대체 스플라이싱 (alternative splicing)"이며, 사람 유전자의 약 95%가 대체 스플라이싱을 거친다. 유전자 수보다 단백질의 종류가 훨씬 많은 이유가 여기 있다.
대체 스플라이싱은 교과서 밖의 이야기가 아니다. 항체 자체가 대표적인 예다.
막결합형과 분비형의 갈림길
B세포 표면에 박혀 있는 항체와 형질세포가 혈액으로 내보내는 항체는 같은 중쇄 유전자에서 나온다. 두 형태를 가르는 것은 유전자가 아니라 전사 후 가공이다.
중쇄 유전자에는 분비형에서 쓰는 폴리아데닐화 부위와, 그보다 아래쪽에 막관통 구간을 암호화하는 엑손이 함께 들어 있다. 전사체가 앞쪽 폴리아데닐화 부위에서 잘리면 분비형 중쇄가 되고, 그 부위를 지나쳐 막 엑손까지 스플라이싱되면 막결합형이 된다. 절단·폴리아데닐화 반응과 스플라이싱 반응이 같은 전사체를 두고 경쟁하는 구조이며, B세포가 형질세포로 분화하면 이 균형이 분비형 쪽으로 기운다.
정리하면 같은 유전자에서 세포막에 붙어 있는 수용체가 나올지, 혈액으로 풀려나는 항체가 나올지를 스플라이싱과 폴리아데닐화의 경쟁이 결정한다. 항체 생산에서 스플라이싱이 사소한 세부가 아니라는 것을 이 사실 하나가 보여 준다.
한 가지 기억할 것은, CHO 세포에 넣는 항체 유전자는 이 갈림길이 이미 정리된 형태라는 점이다. 우리는 분비형 중쇄의 코딩 서열만 골라 벡터에 넣는다. 막 엑손도, 그 앞의 경쟁 구조도 넣지 않는다. 그런데도 뒤에서 보듯 스플라이싱 문제는 사라지지 않는다.


