# 달 표면 하드웨어를 멀티에이전트 설계 루프로 만든 Blue Origin BlueGPT
개요
AWS는 Blue Origin이 BlueGPT라는 사내 AI 생태계를 사용해 달 표면 하드웨어 TEAREx(Thermal Energy Advanced Regolith Extraction)를 수년 단위가 아니라 수일 단위로 설계했다고 소개합니다.[1] BlueGPT는 secure LLM gateway, agent marketplace, multi-agent orchestration platform을 묶은 운영 레이어로 설명되며, AWS 사례는 2,700개 이상의 agent, 전월 350만 건의 interaction, 70% company-wide adoption을 제시합니다.[1] TEAREx 개발에서는 supervisor, librarian, requirements, design, analysis agent가 2-3명의 인간 엔지니어와 함께 요구사항 해석, 내부 지식 검색, 설계안 생성, GPU 시뮬레이션, 결과 평가를 반복했습니다.[1] 이 글은 BlueGPT를 “우주 하드웨어를 AI가 혼자 설계했다”는 이야기가 아니라, 내부 지식과 해석 도구를 agentic loop로 연결한 엔지니어링 운영 모델로 분석합니다.
1. 사례의 핵심: 사내 지식과 시뮬레이션을 연결한 설계 루프
Blue Origin의 문제는 일반적인 문서 자동화가 아닙니다. 달의 14일 밤을 견디는 하드웨어를 설계하려면 열, 구조, 질량, 소재, 제조 가능성, mission requirement를 함께 봐야 합니다. AWS 사례는 공개 LLM이 이런 항공우주·제조·열 배터리 지식을 기본적으로 알기 어렵고, Blue Origin은 proprietary knowledge를 안전하게 쓰면서도 trade/export control 요구를 지켜야 했다고 설명합니다.[1]
BlueGPT의 역할은 이 전문 지식을 agent가 사용할 수 있는 작업 환경으로 바꾸는 것입니다. 공개 사례에서 확인되는 구성은 다음과 같습니다.[1]
| 구성 요소 | 공개 사례의 설명 | 운영 설계상의 의미 | | --- | --- | --- | | Secure LLM gateway | 여러 모델과 agentic application 접근을 보안·거버넌스 아래 제공합니다. | 모델 접근을 개인별 실험이 아니라 enterprise control plane으로 관리합니다. | | Agent marketplace | 직원이 전문 agent를 만들고 재사용합니다. | 성공한 workflow를 일회성 스크립트가 아니라 재사용 자산으로 남깁니다. | | Multi-agent orchestration | Supervisor, librarian, requirements, design, analysis agents가 협업합니다. | 요구사항, 지식 검색, 설계, 해석, 평가의 역할을 분리합니다. | | Simulation loop | EC2 P5/G5에서 physics simulation과 topology optimization을 실행합니다. | Agent output을 물리 모델과 해석 도구로 검증합니다. | | Human supervision | 2-3명의 인간 엔지니어가 agent team과 함께 일합니다. | 최종 책임과 설계 판단은 사람에게 남습니다. |
따라서 BlueGPT는 설계안을 한 번에 뽑아내는 챗봇이 아닙니다. 요구사항을 분해하고, 내부 지식과 도구를 찾아 쓰고, 시뮬레이션 결과를 다시 설계 후보에 반영하는 반복 시스템입니다.
2. 사용된 AI 기술과 agentic design pattern
AWS 사례는 BlueGPT가 Strands Agents SDK, Amazon Bedrock, Amazon Bedrock Knowledge Bases, Amazon Bedrock AgentCore, Amazon EKS, Amazon OpenSearch, Amazon RDS, AWS Lambda, Amazon EC2 P5/G5 등을 사용한다고 설명합니다.[1] 이 목록은 “모델 하나”가 아니라 agent runtime, knowledge retrieval, memory, tool automation, simulation compute가 결합된 구조라는 점을 보여줍니다.
| 기술 요소 | 공개 또는 공식 문서상 근거 | TEAREx 설계 루프에서의 역할 | | --- | --- | --- | | Strands Agents SDK | AWS는 Strands가 model-driven approach로 agent를 만들고, model·tools·prompt를 loop로 연결하며, multi-agent pattern을 지원한다고 설명합니다.[2] | Supervisor agent가 다음 작업을 나누고, domain agent가 요구사항·설계·해석 작업을 수행합니다. | | Amazon Bedrock | AWS는 Bedrock을 production-scale generative AI applications and agents platform으로 설명합니다.[3] | Foundation model 접근과 agent deployment의 기반으로 쓰입니다. | | Bedrock AgentCore | AgentCore는 agent 연결, tool authentication, tracing, security boundary를 지원하는 platform으로 설명됩니다.[4] | Session/persistent memory, tool call control, trace 관찰성을 담당합니다. | | EKS runtime | Amazon EKS는 production-ready Kubernetes application을 쉽게 build/run/scale하는 서비스로 설명됩니다.[5] | Agent runtime, MCP server, 제조·해석 tool connector를 컨테이너로 운영합니다. | | P5/G5 GPU compute | P5는 deep learning/HPC용 고성능 GPU instance이고, G5는 graphics-intensive application과 ML inference/training에 쓰이는 GPU instance입니다.[6][7] | Physics simulation, topology optimization, 분석 workflow 실행에 사용됩니다. |
이 패턴의 핵심은 agent가 설계 도구를 호출할 수 있다는 점입니다. 하지만 도구 호출 가능성이 곧 자동 승인으로 이어지면 위험합니다. 설계 후보, simulation input, manufacturing artifact는 모두 review gate를 지나야 합니다.
3. 공개 사례에서 확인되는 업무 흐름
TEAREx 개발을 일반화하면 다음과 같은 업무 흐름으로 볼 수 있습니다.
| 단계 | 입력과 처리 | 통제 지점 | | --- | --- | --- | | 설계 목표 입력 | 엔지니어가 lunar night, thermal battery, regolith chamber, 질량·제조 제약을 설정합니다.[1] | 요구사항 버전, owner, approval state를 기록합니다. | | 사내 지식 검색 | Librarian agent가 내부 문서, 과거 설계, 시험 데이터, 제조 지식을 검색합니다.[1] | 권한 기반 RAG, source version, stale document flag가 필요합니다. | | 요구사항 분해 | Requirements agent가 모호한 목표를 측정 가능한 조건으로 바꿉니다.[1] | Requirement-to-test mapping과 exception state를 둡니다. | | 설계 후보 생성 | Design agent가 열·구조·질량·제조 가능성을 반영한 후보를 만듭니다.[1] | CAD/CAE input schema와 constraint validation이 필요합니다. | | 시뮬레이션 실행 | Analysis agent가 GPU 기반 simulation과 topology optimization을 실행합니다.[1][6][7] | Queue, job limit, checkpoint, failure state, cost cap을 관리합니다. | | 평가와 반복 | 결과가 요구사항을 만족하지 못하면 agent team이 후보를 수정하고 다시 실행합니다.[1] | 반복 횟수, stop condition, reviewer escalation을 정의합니다. | | 인간 승인과 제조 이관 | 엔지니어가 결과, 근거, simulation artifact를 검토한 뒤 manufacturing handoff를 승인합니다. | 승인 전에는 제조·공급망 시스템에 반영하지 않습니다. |
이 흐름에서 AI는 최종 설계 책임자가 아닙니다. AI는 전문 지식 검색, 설계 후보 생성, 해석 실행, 결과 정리를 자동화해 대기 시간을 줄이는 운영 레이어입니다. 물리적 안전성, mission suitability, 제조 가능성, 테스트 승인 책임은 여전히 엔지니어링 조직에 남습니다.
4. 구현 가능한 시스템 아키텍처
아래 아키텍처는 AWS 사례에 나온 주요 서비스와 일반적인 제조·항공우주 엔지니어링 환경을 바탕으로 구성한 레퍼런스입니다. 실제 Blue Origin 내부 network, model, CAD/CAE tool, security boundary를 복제한 것이 아닙니다.
| 논리 단계 | AWS 서비스 예시 | 역할 | | --- | --- | --- | | BlueGPT portal / gateway | CloudFront, S3, internal ALB, EKS | 임직원이 agent marketplace와 설계 workflow에 접근합니다.[1][5] | | Agent runtime | EKS, Strands Agents SDK | Supervisor/domain agents와 tool connector를 실행합니다.[1][2] | | Model and memory | Bedrock, Bedrock AgentCore | Model call, agent deployment, memory, tool auth, tracing을 담당합니다.[3][4] | | Knowledge retrieval | Bedrock Knowledge Bases, OpenSearch | 요구사항, 설계 이력, 시험 데이터, 제조 지식을 RAG로 검색합니다.[1][3] | | Operational data | RDS, S3 | 요구사항, agent metadata, 설계 artifact, simulation input/output을 보관합니다.[1] | | Workflow automation | Lambda | Simulation submit, result collection, data extraction, handoff task를 자동화합니다.[1] | | Simulation compute | EC2 P5/G5 | GPU 가속 physics simulation과 topology optimization을 수행합니다.[1][6][7] | | Review and handoff | Internal review UI/API, PLM/MES connector | 엔지니어 승인 후 제조·테스트·공급망 단계로 넘깁니다. |
핵심 경로는 requirements → knowledge retrieval → design candidate → simulation job → result evaluation → human review입니다. Agent가 CAD, CAE, MES, PLM 도구를 호출할 수 있더라도 tool output은 승인 전 artifact로 남겨야 합니다.
5. 프로덕션 설계에서 보완할 점
지식 검색의 권한과 freshness를 관리합니다
항공우주 설계 지식은 공개 문서보다 내부 시스템, 시험 결과, 전문가 경험에 더 많이 있습니다.[1] RAG index가 오래된 요구사항이나 폐기된 설계안을 가져오면 agent가 빠르게 잘못된 방향으로 반복할 수 있습니다. 따라서 source freshness, document owner, export-control marking, project access scope를 retrieval layer에 넣어야 합니다.
Tool call과 simulation queue에 안전장치를 둡니다
Strands 같은 agent framework는 모델이 도구를 선택하고 결과를 다시 받아 loop를 이어가게 만듭니다.[2] 이 구조는 생산성을 높이지만, 잘못된 tool call이 비용과 리스크를 키울 수 있습니다. Simulation job에는 cost cap, queue quota, schema validation, max iteration, checkpoint, early-stop, reviewer escalation이 필요합니다. EC2 On-Demand는 instance-hour 또는 초 단위 과금 구조이므로 GPU job-hours가 바로 비용 driver가 됩니다.[10]
설계 책임은 agent가 아니라 엔지니어링 gate에 둡니다
AWS 사례는 2-3명의 인간 엔지니어가 agent team과 함께 일했다고 설명합니다.[1] 이 문장을 “사람이 필요 없어졌다”로 읽으면 안 됩니다. Agent가 요구사항을 분해하고 설계안을 만들 수 있어도, physical test, safety review, manufacturability, supplier impact, mission approval은 사람이 검토해야 합니다.
Agentic AI 보안 리스크를 하드웨어 workflow에 맞게 해석합니다
NIST AI RMF는 AI risk management를 설계·개발·운영 전반에서 다루도록 합니다.[8] OWASP LLM Top 10은 prompt injection, sensitive information disclosure, excessive agency 같은 위험을 제시합니다.[9] 제조·항공우주에서는 이 위험이 단순 오답보다 더 큽니다. 잘못된 retrieved document, 권한 없는 supplier data 접근, 과도한 simulation 실행, 승인되지 않은 manufacturing handoff가 실제 비용과 안전 리스크로 이어질 수 있기 때문입니다.
6. 구축 및 운영 비용
Blue Origin의 내부 운영비와 TEAREx simulation job 수는 공개되지 않았습니다. 따라서 비용은 확정 견적이 아니라 workload budget으로 관리해야 합니다.
- 가정: 월 1개 설계 파일럿, agent run 200회, retrieval/tool call 2,000회, GPU simulation 50-300 job-hours, simulation artifact 1-5TB, 엔지니어 review 2-3명.
- 모델·agent 비용: Bedrock/AgentCore, Knowledge Bases, OpenSearch, RDS, EKS, Lambda, logging 비용이 발생합니다.[1][3][4][5]
- GPU 비용: P5/G5는 각각 HPC/deep learning과 graphics/ML workload에 적합한 GPU instance군입니다.[6][7] 실제 월 비용은 instance type, region, On-Demand/Spot/Savings Plans, job-hours에 따라 달라지며, EC2 On-Demand pricing은 instance-hour 또는 초 단위 과금 구조를 따릅니다.[10]
- 예산 cap: early pilot에서는 GPU simulation과 artifact 저장을 분리해 월 $5,000-$50,000 같은 guardrail을 먼저 정하고, job queue가 cap을 넘으면 사람이 승인하도록 두는 편이 안전합니다.
- 제외: 실제 CAD/CAE license, PLM/MES integration, proprietary solver, security review, export-control review, physical prototyping, 3D printing, test campaign, supplier communication 비용은 제외했습니다.
이 사례의 비용 중심은 token보다 simulation loop입니다. Agent가 설계 후보를 많이 만들수록 simulation queue와 artifact storage가 늘어납니다. 따라서 품질 기준 없이 반복 횟수만 늘리는 구조는 생산성 개선이 아니라 비용 폭증으로 끝날 수 있습니다.
7. 비즈니스 이익과 KPI
AWS 사례의 정량 지표는 기준을 나눠 읽어야 합니다. 페이지 요약 문구는 “lunar hardware development by 75%”라고 표현하지만, 세부 outcome bullet은 concept-to-printed-part 기준으로 hardware development가 수년에서 수일로 줄어 90% 감소했다고 설명합니다.[1] 이 글에서는 세부 기준을 붙여 90% 수치를 인용하되, 같은 페이지 안에 75% 요약 표현도 있음을 리스크로 남깁니다.
| KPI 묶음 | 공개 또는 적용 지표 | 해석 | | --- | --- | --- | | 설계 속도 | Concept-to-printed-part가 years에서 days로 감소, 90% reduction으로 제시됨.[1] | 특정 TEAREx workflow 기준이며 보편 하드웨어 개발 지표로 일반화하면 안 됩니다. | | 분석 속도 | 4 days에서 4 hours로 줄어 6x acceleration.[1] | Agent가 해석 도구 실행과 결과 평가 대기 시간을 줄인 효과로 해석할 수 있습니다. | | 조직 확산 | 2,700+ agents, 3.5M interactions, 70% adoption.[1] | 플랫폼형 도입과 agent marketplace의 재사용성을 보여줍니다. | | 제조 운영 | Non-conformance resolution 70% faster.[1] | 설계 외 제조·품질 업무로 확장된 사례입니다. | | 품질·안전 | Requirement satisfaction, simulation pass rate, reviewer override, test correlation | 공개 수치가 부족하므로 자체 KPI로 반드시 보강해야 합니다. |
진짜 이익은 “AI가 하드웨어를 설계합니다”가 아니라, 전문 지식 검색과 해석 실행 사이의 대기 시간을 줄이는 데 있습니다. 소수 엔지니어가 더 많은 설계 후보를 빠르게 검토할 수 있고, 성공한 agent pattern이 marketplace에 남아 다른 부품·조립·품질 workflow로 재사용됩니다.[1]
8. 제조·B2B 기업에 주는 시사점
제조·B2B 기업도 BlueGPT 패턴을 그대로 복제할 필요는 없습니다. 다만 내부 지식, 요구사항, 해석 도구, 승인 절차가 흩어져 있다면 유사한 agentic loop를 만들 수 있습니다.
- 부품 설계에서는 요구사항을 testable constraint로 분해하고, CAD/CAE job queue를 agent tool로 연결합니다.
- 품질 이슈에서는 non-conformance report, 검사 성적서, 공정 조건, 과거 corrective action을 검색합니다.
- 공급업체 변경에서는 설계 변경, 납기, 인증, 원가 영향을 agent가 초안 분석합니다.
- 설비 troubleshooting에서는 매뉴얼, 센서 로그, 과거 장애 기록, 현장 사진을 결합합니다.
- 제조 승인 문서에서는 요구사항, 근거 문서, simulation result, reviewer approval을 audit trail로 묶습니다.
적용 순서는 보수적으로 잡아야 합니다. 첫 단계는 read-only knowledge retrieval과 report drafting입니다. 두 번째는 simulation job 제출처럼 제한된 tool action입니다. 세 번째는 PLM/MES/ERP handoff인데, 이 단계는 승인·감사·rollback이 충분히 검증된 뒤에만 열어야 합니다.
9. 도입 체크리스트
| 점검 항목 | 완료 기준 | | --- | --- | | 요구사항 정의 | 설계 목표가 측정 가능한 constraint와 test로 분해돼 있습니다. | | 지식 정본 | 설계 문서, 시험 데이터, 제조 지식, supplier 자료의 owner와 freshness가 관리됩니다. | | 권한 기반 RAG | Agent가 project scope 밖의 문서를 검색하지 못합니다. | | Agent 역할 | Supervisor, librarian, requirements, design, analysis 역할과 handoff가 분리돼 있습니다.[1] | | Tool action | CAD/CAE/MES/PLM tool call이 allowlist, schema, quota, approval policy로 통제됩니다. | | Simulation 비용 | GPU job-hours, queue cap, early-stop, checkpoint, failed job retry가 정의돼 있습니다.[6][7][10] | | Audit trail | Requirement version, retrieved source, tool call, model version, simulation result, reviewer approval이 남습니다. | | Human gate | 엔지니어 승인 전에는 제조·공급망·고객 제출 시스템에 반영되지 않습니다. | | 보안 방어 | Prompt injection, sensitive information disclosure, excessive agency 방어가 설계돼 있습니다.[9] | | 평가 | Simulation 결과와 physical test correlation, reviewer override, 반복 실패 유형을 측정합니다. |
결론
Blue Origin BlueGPT 사례의 본질은 우주 하드웨어를 AI에게 맡긴 것이 아니라, 내부 지식과 해석 도구를 멀티에이전트 설계 루프로 묶은 점입니다. 공개 사례에서 확인되는 축은 secure LLM gateway, agent marketplace, Strands 기반 multi-agent orchestration, Bedrock/AgentCore, EKS runtime, OpenSearch RAG, EC2 P5/G5 simulation compute, 인간 엔지니어 review입니다.[1][2][3][4][5][6][7] 제조·B2B 기업이 이 모델을 참고하려면 agent 수보다 요구사항 정본, tool 권한, simulation cost cap, audit trail, human approval gate를 먼저 설계해야 합니다.[8][9][10] 그렇게 해야 빠른 설계 반복이 품질·안전·비용 리스크로 바뀌지 않습니다.
출처
- How Blue Origin Built the First AI Agent-Designed Hardware for the Moon in Days, Not Years. AWS. 2026 access 기준. https://aws.amazon.com/solutions/case-studies/blue-origin-case-study/. 접근일: 2026-07-07.
- Introducing Strands Agents, an Open Source AI Agents SDK. AWS Open Source Blog. 2025-05-16. https://aws.amazon.com/blogs/opensource/introducing-strands-agents-an-open-source-ai-agents-sdk/. 접근일: 2026-07-07.
- Amazon Bedrock. AWS. 2026 access 기준. https://aws.amazon.com/bedrock/. 접근일: 2026-07-07.
- Amazon Bedrock AgentCore. AWS. 2026 access 기준. https://aws.amazon.com/bedrock/agentcore/. 접근일: 2026-07-07.
- Amazon Elastic Kubernetes Service. AWS. 2026 access 기준. https://aws.amazon.com/eks/. 접근일: 2026-07-07.
- Amazon EC2 P5 instances. AWS. 2026 access 기준. https://aws.amazon.com/ec2/instance-types/p5/. 접근일: 2026-07-07.
- Amazon EC2 G5 Instances. AWS. 2026 access 기준. https://aws.amazon.com/ec2/instance-types/g5/. 접근일: 2026-07-07.
- AI Risk Management Framework. National Institute of Standards and Technology. 2023/2024/2026 access 기준. https://www.nist.gov/itl/ai-risk-management-framework. 접근일: 2026-07-07.
- OWASP Top 10 for LLM Applications 2025. OWASP Foundation. 2025. https://genai.owasp.org/llm-top-10/. 접근일: 2026-07-07.
- Amazon EC2 On-Demand Pricing. AWS. 2026 access 기준. https://aws.amazon.com/ec2/pricing/on-demand/. 접근일: 2026-07-07.