한 줄 정의

Attention모델이 입력 안의 여러 토큰 사이 관계를 계산해서 지금 위치를 만들 때 무엇을 얼마나 반영할지 정하는 내부 메커니즘이야. 새 모델 이름이나 브랜드가 아니라 문맥 속 정보의 비중을 정하는 계산 규칙이라고 보면 돼.

어떻게 작동하나

Attention은 구조 안에서 정보 참고 범위를 정하는 계산이라, 지금 위치의 query와 문맥 각 위치의 key를 비교해 관련도 점수를 만들고 그 가중치로 value를 섞는 과정으로 이해하면 돼. 흔히 Attention(Q, K, V) = softmax(QK^T / √d_k)V처럼 적는데, 핵심은 현재 위치가 문맥 어디를 얼마나 참고할지 점수로 정한 뒤 그 비중만큼 정보를 다시 모으는 데 있어. 모델은 이렇게 중요한 토큰 정보는 더 크게, 덜 중요한 토큰 정보는 더 작게 섞어서 현재 표현을 만들고, 그 결과를 다음 층 계산과 다음 토큰 예측에 바로 써.

왜 중요한가

Transformerattention을 중심 부품으로 엮은 전체 아키텍처라서, 긴 문맥을 다루는 방식을 이해하려면 attention을 먼저 알아야 해. 필요한 위치를 직접 참조해 현재 계산에 끌어올 수 있기 때문에 번역, 요약, 질의응답, 코드 생성 같은 작업에서 차이가 크게 나. 반대로 Mixture of Experts는 어떤 전문가 모듈을 호출할지 고르는 구조라서, attention처럼 토큰끼리의 관련도를 계산하는 층과는 비교 축이 달라. 기사에서 attention을 줄였다고 하거나 다른 방식으로 바꿨다고 하면, 그건 새 모델 이름보다 내부 구조와 비용 구조가 달라졌다는 뜻에 더 가까워.

주의해서 볼 점

Attention이 강력하다고 해서 공짜는 아니야. 기본 self-attention은 길이 n인 입력에서 토큰 관계를 대체로 n × n으로 비교해서 층당 복잡도가 O(n² · d)로 커져. 예를 들어 4,096 토큰이면 관계 점수 칸이 4,096² = 16,777,216개이고, 8,192 토큰이면 67,108,864개로 4배가 돼서 계산량과 메모리 부담이 빠르게 커질 수 있어. 또 attention 점수는 참고 비중을 보여 주는 신호일 뿐이라서 그것만 보고 모델 내부 판단 전체가 투명하게 드러난다고 생각하면 과한 해석이 돼.