2026-07-02 기준레벨 4

펄스 최적화

펄스 최적화는 게이트 불충실도 C = 1 − F에 대한 경사하강법으로 제어 파형을 수치적으로 조각하는 일입니다 — GRAPE의 해석적 기울기(2005)부터, 기울기가 잡음 자체를 관통해 흐르는 현대의 미분가능 열린 계 최적화기까지.

무슨 뜻인가요

게이트를 제어 포락선 ε(t)로 이해하고 나면, 최고의 게이트를 찾는 일은 최적화 문제가 됩니다: 실현된 발전과 목표 유니터리 사이의 충실도 F에 대해 비용 C = 1 − F를 최소화하는 것입니다.경사하강법은 펄스 파라미터 θ를 기울기의 반대 방향으로 갱신합니다: θ_{k+1} = θ_k − η∇_θC(θ_k).GRAPE(Khaneja 외, 2005)가 이 문제에 해석적 기울기를 도입했고, 자동미분(autograd)이 이를 일반화합니다 — 시간 발전 전체(예: 트로터 분할 린드블라드 전파기)를 PyTorch 연산으로 구성하면, 역전파 한 번으로 모든 파라미터의 정확한 기울기가 동시에 나옵니다.유한차분이라면 파라미터마다 시뮬레이션이 한 번씩 필요합니다.현대 펄스의 파라미터가 수백~수천 개이므로 이것이 결정적입니다.최전선은 열린 계 최적화입니다: 잡음 없는 슈뢰딩거 시뮬레이션에서 최적화한 뒤 점수를 사후 할인(e^{−T/T1} 곱하기)하는 대신, GradPulse 같은 미분가능 최적화기는 린드블라드 마스터 방정식을 통해 T1 이완, 순수 위상풀림(Tφ), 누설을 순전파(forward pass) 안에 넣습니다 — 옵티마이저가 진짜 잡음 세계의 점수판 위를 걷는 것입니다.대가는 큽니다 — 밀도행렬은 d×d이므로 27차원 명시적 커플러 모델은 원소가 729개입니다 — 그리고 전파기를 새로 쓰는 일은 독립 솔버(정확한 행렬지수, 적응형 ODE QuTiP)와의 약 10⁻¹⁴ 수준 교차검증을 요구하며, 이는 CI로 강제됩니다.

일상 비유

안개 낀 산을 눈 가리고 내려간다고 상상해 보세요: 지도는 볼 수 없지만 발바닥은 경사를 느낍니다 — 그것이 기울기입니다. 내리막 쪽으로 반 걸음, 다시 느끼고, 수천 번 반복하면 골짜기 바닥에 닿습니다. 그리고 마법의 되감기(역전파)가 있습니다: 손잡이가 1,000개 달린 기계라면 순진하게는 손잡이마다 한 번씩 1,000번의 실험이 필요하지만 — 기계를 한 번 돌리고 비디오를 거꾸로 감으면, 1,000개 손잡이 전부의 정답 방향이 화면에 한꺼번에 나타납니다. 마지막으로 두 코치를 떠올려 보세요: 코치 A는 조용한 방에서 선수를 훈련시키고 시끄러운 경기장 몫을 나중에 점수에서 할인합니다; 코치 B(미분가능 열린 계 최적화기)는 시끄러운 경기장 그 자체에서 훈련시킵니다 — 매 걸음이 실제 조건에서 채점됩니다.
'최적화'의 한자어 최적화(最適化)는 가장 최(最) + 알맞을 적(適) + 될 화(化) — '가장 알맞게 만듦'입니다. 영어 optimize는 라틴어 optimus('가장 좋은', bonus '좋은'의 최상급)에서 왔고 낙관주의(optimism)와 형제 단어입니다 — 최적화는 수학이 된 낙관주의, 즉 최고의 펄스가 존재하며 걸어서 도달할 수 있다는 믿음을 엄밀하게 만든 것입니다. gradient는 라틴어 gradus('걸음')에서 왔으며 grade, degree, progress와 형제입니다 — 경사하강법은 문자 그대로 '한 걸음씩 내려가기'입니다.

흔한 오해

  • 기울기 없는(gradient-free) 최적화는 규모에 맞게 확장되지 않습니다 — 펄스 파라미터가 수백~수천 개일 때 Nelder-Mead 같은 방법은 차원이 커질수록 급격히 느려지지만, 역전파는 되감기 한 번으로 모든 기울기를 줍니다. 미분가능성은 취향이 아니라 규모의 생존 조건입니다.
  • 두 시뮬레이터가 일치해도, 코드를 공유하거나 같은 근사 계열을 쓴다면 아무것도 증명하지 못합니다 — 공유된 트로터류 시간 이산화는 둘 사이 비교로는 보이지 않는 공통 모드 오차를 만듭니다. 독립적 재구현(정확한 행렬지수 vs 트로터 분할 vs 적응형 ODE)만이 일치를 증거로 만듭니다.

핵심 정리

  • GRAPE(2005)가 펄스 설계에 해석적 기울기를 도입했고, autograd가 이를 임의의 미분가능 시뮬레이션으로 일반화합니다.
  • 역전파는 역방향 계산 한 번으로 모든 펄스 파라미터의 기울기를 줍니다 — 유한차분이라면 파라미터마다 시뮬레이션이 한 번씩 필요합니다.
  • 열린 계의 비용: 밀도행렬은 d×d이므로 27차원 명시적 커플러 모델은 원소가 729개입니다 — 정직한 잡음 모델링은 비쌉니다.
  • 미분가능 열린 계 최적화기는 사후 e^{−T/T1} 할인 대신 T1, Tφ, 누설을 순전파 안에 넣습니다 — 기울기가 잡음을 관통해 흐릅니다.
  • 3중 솔버 교차검증(PyTorch 트로터 vs 정확한 NumPy 행렬지수 vs QuTiP 적응형 ODE)의 약 10⁻¹⁴ 일치가 전사(transcription) 버그를 잡아내며, 어느 두 솔버라도 어긋나면 CI 게이트가 빌드를 실패시킵니다.

이해했는지 확인해 보세요

규모가 커질 때 미분가능성이 (단순한 취향이 아니라) 생존 조건인 이유는 무엇입니까?

  1. A.아날로그 하드웨어가 미분가능한 파형만 받아들이기 때문
  2. B.파라미터가 수백~수천 개일 때, 역전파의 역방향 계산 한 번만이 기울기 계산을 현실적으로 가능하게 하기 때문
  3. C.기울기 없는 방법으로는 가우시안 포락선을 표현할 수 없기 때문
  4. D.미분가능 코드는 GPU에서 돌고 GPU가 필수이기 때문
정답 보기

정답: B. 파라미터가 수백~수천 개일 때, 역전파의 역방향 계산 한 번만이 기울기 계산을 현실적으로 가능하게 하기 때문

이유: 유한차분은 파라미터마다 시뮬레이션이 한 번씩 필요하고, 기울기 없는 탐색은 차원이 커질수록 급격히 느려집니다. 역전파는 되감기 한 번으로 모든 파라미터의 정확한 기울기를 주므로, 수백~수천 개 펄스 분절 규모에서 유일하게 현실적인 경로입니다.

미분가능 열린 계 최적화기에서 '기울기가 잡음을 관통해 흐른다'는 말의 정확한 뜻은 무엇입니까?

  1. A.국소 최솟값 탈출을 위해 옵티마이저가 기울기에 무작위 잡음을 더한다
  2. B.잡음 있는 하드웨어 실행 여러 번에 걸쳐 기울기를 평균한다
  3. C.손실의 계산 경로에 린드블라드 잡음 항(T1, Tφ, 누설)이 autograd 그래프 안에 포함되어, ∂C/∂θ가 잡음의 효과까지 반영한다
  4. D.잡음은 무작위라서 기울기에서 상쇄되어 사라진다
정답 보기

정답: C. 손실의 계산 경로에 린드블라드 잡음 항(T1, Tφ, 누설)이 autograd 그래프 안에 포함되어, ∂C/∂θ가 잡음의 효과까지 반영한다

이유: 이완·위상풀림·누설 항을 포함한 린드블라드 발전 전체가 미분가능 연산으로 구성되어 있으므로, 계산된 기울기는 각 파라미터가 잡음 세계에서 충실도를 어떻게 바꾸는지를 이미 반영합니다 — 사후 e^{−T/T1} 할인과의 본질적 차이입니다.

먼저 알아야 할 개념

GRAPE gradient core is established (Khaneja 2005); the differentiable open-system tooling landscape incl. GradPulse case study (PureStateLabs/gradpulse, existence+claims verified on GitHub 2026-07-03) is current-state, hence timebound.

직접 실습으로 배우기

이 개념은 46레벨 커리큘럼의 일부입니다. 인터랙티브 시뮬레이터, 그리고 답변을 표시 전에 검증하는 튜터 Lumen과 함께 배웁니다. 레벨 1–5는 무료입니다.