
오픈소스 vs 독점 AI 에이전트 빌더: 2025년 비용-효과 분석
2025년 오픈소스와 독점 AI 에이전트 빌더의 비용, 유연성, 성능, ROI를 종합적으로 분석하여 조직이 정보에 입각한 결정을 내릴 수 있도록 돕는 보고서입니다....
OpenAI의 Astra 모델이 기계로 검증 가능한 증명과 함께 10개의 수십 년 묵은 수학 난제를 풀었고, 마이크로소프트는 AI 에이전트를 훨씬 저렴한 비용으로 훈련하는 프레임워크 Orchard를 오픈소스로 공개했습니다. 두 소식이 자동화를 구축하는 팀에 의미하는 바를 알아보세요.
2026년 8월 첫째 주에 나온 두 가지 소식은 AI가 어디로 향하고 있는지에 대한 더 큰 이야기를 들려줍니다. OpenAI는 차세대 모델인 Astra의 내부 버전을 10년 이상 미해결로 남아 있던 10개의 수학 및 이론 컴퓨터과학 문제에 풀어놓았고, 이 모델은 약 2,000달러의 컴퓨팅 비용으로 모든 문제에 대해 기계로 검증 가능한 증명을 만들어냈습니다. 며칠 뒤 마이크로소프트 리서치는 Orchard를 오픈소스로 공개했습니다. 이는 에이전트가 학습하는 방식과 실제 프로덕션에서 실행되는 방식을 분리함으로써 유능한 AI 에이전트를 훈련하는 비용을 대폭 낮추는 프레임워크입니다. 두 이야기 모두 챗봇에 새 옷을 입히는 것과는 거리가 멉니다. 둘 다 추론하고 행동하는 AI 시스템을 구축하는 데 드는 근본적인 비용과 역량 곡선에 관한 것이며, 이는 바로 다음 세대 AI 에이전트가 얼마나 뛰어나고 얼마나 저렴해질지를 결정하는 요소입니다.
8월 1일, OpenAI는 놀라운 주장을 발표했습니다. Astra의 내부 버전이 순수 수학과 이론 컴퓨터과학 분야의 10개 미해결 문제에서 새로운 결과를 냈으며, 그중 몇 개는 20년 넘게 풀리지 않은 문제였다는 것입니다. 가장 주목할 만한 성과는 소피군이 아닌(non-sofic) 그룹의 명시적 구성으로, 이는 미하일 그로모프가 1999년 소피성(soficity) 개념을 도입한 이래 미해결로 남아 있던 문제입니다. Astra는 또한 동일한 폰 노이만 대수를 공유하는 무한히 많은 비동형 그룹을 구성함으로써 Connes’s rigidity conjecture를 반증했고, Ehrhart’s volume conjecture도 증명했습니다. 이 결과들은 군론, 고차원 기하학, 양자 복잡도, 격자 암호, 극단 조합론에 걸쳐 있으며, 이는 보통 언어 모델과 같은 문장에 등장하지 않는 분야들입니다.
이 소식을 흔한 ‘AI가 어려운 문제를 풀었다’는 헤드라인과 다르게 만드는 것은 검증 방식입니다. OpenAI는 단순히 주장만 발표한 것이 아니라, 10개 결과 모두에 대해 기계로 검증 가능한 Lean 4 증명 인증서를 Apache 2.0 라이선스로 GitHub에 공개했으며, 249페이지 분량의 기술 논문도 함께 내놓았습니다. 저장소의 ‘sorry’ 개수는 0으로, 형식화된 증명의 어떤 단계도 미증명 상태로 남거나 대충 넘어간 부분이 없다는 뜻입니다. 이는 모델이 무언가를 풀었다고 주장하는 것과는 의미 있게 다른 기준입니다. Lean 증명은 그것을 만들어낸 모델을 신뢰하는지 여부와 무관하게, 타입 체크를 통과하거나 통과하지 못하거나 둘 중 하나이기 때문입니다. 필즈상 수상자인 티모시 가워스는 그중 한 증명을 주저 없이 최고 수준의 저널에 추천하겠다고 말한 것으로 알려졌습니다 — 다만 10개 결과 중 어느 것도 아직 실제로 동료 평가를 완료하지 않았다는 점은 정확히 짚어둘 필요가 있습니다.
이를 ‘인상적이지만 내 비즈니스와는 무관하다’고 치부하고 싶어질 수 있습니다. 하지만 그것은 실수입니다. Astra가 보여준 역량 — 한 번의 잘못된 단계가 전체 결과를 무효화하는, 지속적인 다단계 형식 추론 — 은 구조적으로 AI 에이전트를 긴 비즈니스 워크플로우에서 신뢰할 수 있게 만드는 능력과 동일합니다. 보험 청구를 처리하거나, 여러 건의 인보이스를 대조하거나, 법률 문서를 작성하는 에이전트는 같은 일의 규모가 작고 덜 화려한 버전을 수행하고 있는 셈입니다. 즉, 초기의 실수가 누적되는 긴 연쇄의 단계를 따라가는 일이며, 프로덕션 환경을 위해 구축된 실제 AI 에이전트 사례 목록에서 흔히 볼 수 있는 것과 같은 패턴입니다. 249페이지에 달하는 수학적 증명에서 자신의 오류를 잡아내는 능력이 눈에 띄게 향상된 모델은, 12단계짜리 자동화 과정에서 오류를 잡아내는 능력도 함께 향상되는 경향이 있습니다. 이 수학적 성과는 극단적이고 검증 가능한 사례로서, 모든 하위 에이전트의 추론 한계가 앞으로 어디로 향할지를 미리 보여줍니다.
FlowHunt를 사용하면 연구팀도, 인프라 구축도 없이 최신 모델 위에서 다단계 AI 에이전트를 구축할 수 있습니다 — 그저 작동하는 자동화만 남습니다.
Astra가 추론이 어디까지 나아갈 수 있는지에 관한 이야기라면, 마이크로소프트의 Orchard 공개는 유능한 에이전트를 얼마나 저렴하게 만들 수 있는지에 관한 이야기입니다. Orchard는 마이크로소프트 리서치의 오픈소스 프레임워크로, 에이전트 훈련과 에이전트 실행을 의도적으로 분리합니다. 점점 더 큰 기반 모델을 작업에 투입하는 대신, 개발자는 재사용 가능한 환경 서비스인 Orchard Env를 사용해 더 작은 에이전트를 현실적인 작업 시뮬레이션 안에서 훈련시킨 뒤에야 프로덕션 시스템에 투입합니다. 동일한 인프라가 소프트웨어 엔지니어링 에이전트, 웹 탐색 에이전트, 개인 비서 에이전트를 모두 지원하며, 훈련이 끝나면 Codex, OpenClaw, ZeroClaw 같은 실제 배포 하네스에 곧바로 연결됩니다.
주목할 만한 부분은 효율성 수치이며, 이는 어떤 스택 위에 구축할지 선택할 때 AI 에이전트 프레임워크 간 비용 효율성 비교가 중요한 것과 같은 이유로 중요합니다. Orchard 프레임워크로 훈련된 코딩 에이전트인 Orchard-SWE는 실제 소프트웨어 엔지니어링 작업을 평가하는 데 널리 쓰이는 벤치마크인 SWE-bench Verified에서 69.7%를 기록했으며, 가치 모델 재순위화를 적용하면 73.0%까지 상승합니다. 이 모든 것이 약 30억 개의 활성 파라미터만으로 이뤄집니다. 이는 성능 면에서 근접하고 있는 최첨단 코딩 모델 규모의 아주 작은 일부에 불과합니다. 마이크로소프트 팀은 더 큰 모델로부터 약 10만 7,000개의 작업 궤적을 증류한 뒤, 완전히 성공하지 못한 궤적에서도 유용한 신호를 학습하는 이른바 ‘신용 할당 지도 미세조정(credit-assignment supervised fine-tuning)‘을 적용하고, 이어서 강화학습을 적용하는 방식으로 이를 구축했습니다.
Orchard의 배경에 있는 아키텍처적 선택 — 에이전트의 역량을 훈련하는 것과 이를 프로덕션에서 실행하는 것을 분리하는 것 — 은 ML 연구자뿐 아니라 자동화를 구축하는 모든 사람에게 중요한 구분과 맞닿아 있습니다. 특정 산업 작업을 위해 만들어진 버티컬 AI 에이전트는 전반적으로 더 큰 두뇌를 필요로 하지 않습니다. 실제로 마주하게 될 좁은 범위의 의사결정에 집중적인 연습이 필요할 뿐이며, 이것이 바로 Orchard 방식의 훈련 환경이 범용 모델을 확장하는 것보다 더 저렴하게 제공하는 것입니다. 이 논리는 모델을 처음부터 훈련하든 노코드 에이전트를 구성하든 동일하게 적용됩니다. 현실적인 작업에 대한 좁고 명확하게 정의된 훈련은, 그 문제를 풀도록 만들어지지 않은 더 일반적인 역량을 그냥 더 많이 투입하는 것을 항상 능가합니다.
이는 또한 마이크로소프트의 이번 공개에서 단순히 벤치마크 수치를 발표하는 것보다 프레임워크 자체를 오픈소스로 공개하는 것이 왜 더 중요한 부분인지도 설명해줍니다. 누구나 자신의 작업 환경에서 지능형 에이전트를 훈련하는 데 사용할 수 있는 프레임워크는 복리 효과를 냅니다. 이를 채택하고 개선 사항을 공유하는 모든 팀이 다음 팀의 에이전트를 더 저렴하게 만드는 데 기여하며, 이는 지난 20년간 오픈소스 소프트웨어가 인프라 스택을 잠식해온 것과 동일한 역학입니다.
한 걸음 더 물러나 보면, 두 소식 모두 가트너가 내놓은 기업 도입 속도에 관한 예측을 뒷받침합니다. 가트너는 2026년 말까지 기업용 애플리케이션의 40%가 특정 작업 전용 AI 에이전트를 내장할 것이며, 이는 2025년의 5% 미만에서 크게 늘어난 수치라고 전망했습니다. 단 1년 만에 8배로 늘어난다는 것은 공격적인 전망이지만, Astra의 성과와 Orchard 같은 프레임워크는 바로 이 전망이 그럴듯해지기 위해 필요한 근본적인 역량-비용 구조 변화의 정확한 사례입니다 — 더 저렴한 훈련은 더 좁은 작업을 위한 에이전트를 구축하는 것을 경제적으로 만들고, 더 나은 추론은 그렇게 좁게 만들어진 에이전트를 실제로 배포할 만큼 신뢰할 수 있게 만듭니다.
가트너의 정의는 구체적이며 기억해둘 가치가 있습니다. 특정 작업 전용 에이전트란 정의된 하나의 작업을 처음부터 끝까지 처리하도록 만들어진 것으로, 가트너가 제시한 예시는 네트워크 트래픽, 시스템 로그, 사용자 행동을 실시간으로 스캔하고 스스로 대응을 시작하는 사이버보안 에이전트입니다. 이는 ‘앱에 챗봇이 있다’는 것과는 다른 기준입니다. AI 기능과 AI 워커의 차이이며, 이는 일반적인 어시스턴트와 하나의 작업을 처음부터 끝까지 안정적으로 처리하도록 만들어진 제대로 된 리서치 어시스턴트를 구분하는 것과 같은 구분입니다.
Astra도 Orchard도 대부분의 비즈니스가 직접 다룰 만한 대상은 아닙니다 — Lean 증명으로 모델을 파인튜닝하거나 자체 Orchard 훈련 파이프라인을 구축할 일은 없을 것입니다. 중요한 것은 무엇이 아래로 흘러 내려오는가입니다. 최첨단 추론의 개선은 결국 이미 노코드 자동화 플랫폼을 구동하고 있는 모델을 포함해, 모든 하위 모델이 안정적으로 해낼 수 있는 일의 한계를 끌어올립니다. 더 저렴하고 효율적인 훈련 기법은 결국 그런 모델 위에 구축된 특화 에이전트의 비용을 낮춥니다. 두 소식 모두 이번 분기에 당신이 무엇을 만들어야 하는지를 바꾸지는 않습니다 — 하지만 다음 분기에 무엇이 가능해지고 저렴해질지에 대한 꽤 신뢰할 만한 신호입니다. 실용적인 대응은 연구를 뒤쫓는 것이 아니라, 기반 모델의 개선을 자동으로 흡수할 만큼 유연한 AI 에이전트 플랫폼 위에 자동화를 구축하는 것입니다. 이는 불과 몇 주 전 Claude Cowork와 그 경쟁자들이 에이전트 지형을 어떻게 재편했는지 다뤘을 때 중요했던 것과 동일한 감각입니다.
기반 모델이 계속 개선되는 와중에 무엇을 먼저 자동화할지 결정해야 한다면, 가장 안전한 출발점은 범위가 좁고, 명확하게 정의되어 있으며, 검증하기 쉬운 작업입니다 — 이는 Orchard의 훈련 방식을 효과적으로 만든 것과 동일한 특성입니다. 키워드 리서치, 문서 요약, 구조화된 데이터 추출이 흔한 출발점인 이유는 성공 여부를 확인하기 쉽고 실패의 비용이 적기 때문입니다. 추론이 향상되고 훈련이 더 효율적으로 발전함에 따라, 동일한 원칙이 더 야심 차고 더 오래 실행되는 워크플로우로 확장됩니다 — 하지만 그 시작은 에이전트가 실제로 제대로 해냈는지를 빠르고 저렴하게 확인할 수 있는 작업을 고르는 것입니다.
2026년 8월은 겉보기에는 서로 아무런 관련이 없어 보이는 두 가지 발표로 시작되었습니다 — 수십 년 묵은 수학 문제를 푸는 모델, 그리고 코딩 에이전트를 위한 훈련 프레임워크. 그 이면을 들여다보면 둘 다 동일한 힘에 관한 이야기입니다. 추론을 얼마나 멀리까지 밀어붙일 수 있는가, 그리고 그 추론을 얼마나 저렴하게 실제로 작동하는 에이전트로 바꿀 수 있는가입니다. Astra는 그 한계가 여전히 높아지고 있음을 보여줍니다. Orchard는 그 한계의 쓸모 있는 부분에 도달하는 비용이 빠르게 낮아지고 있음을 보여줍니다. 이 둘을 합쳐보면, 가트너의 공격적인 도입 전망이 처음 보기보다 훨씬 그럴듯하다고 믿을 만한 좋은 이유가 됩니다 — 그리고 자동화를 구축하는 모든 팀에게, 두 흐름이 계속되는 동안 계속 그 혜택을 누릴 수 있을 만큼 자신들의 도구가 충분히 유연한지 확인해야 할 좋은 이유이기도 합니다.
야샤는 파이썬, 자바, 머신러닝을 전문으로 하는 재능 있는 소프트웨어 개발자입니다. 야샤는 AI, 프롬프트 엔지니어링, 챗봇 개발에 관한 기술 기사를 작성합니다.

최신 추론 및 에이전트 기술의 혜택을 누리기 위해 연구소가 필요하지는 않습니다. FlowHunt를 사용하면 코드 작성 없이 최신 모델 위에서 프로덕션급 AI 에이전트를 구축할 수 있습니다.

2025년 오픈소스와 독점 AI 에이전트 빌더의 비용, 유연성, 성능, ROI를 종합적으로 분석하여 조직이 정보에 입각한 결정을 내릴 수 있도록 돕는 보고서입니다....

OpenAI의 인스턴트 체크아웃 붕괴는 에이전틱 커머스 실패가 아니었습니다. 인프라 격차를 노출했습니다. 실제로 작동하는 것과 판매자가 알아야 할 사항은 다음과 같습니다....

런던 AIE 서밋 2026에서 배운 것: 에이전트 혼란, 속도 대 품질 논쟁, IDE의 죽음, MCP의 역설, 그리고 AI가 우리를 더 열심히 일하게 만든 이유....
쿠키 동의
당사는 귀하의 브라우징 경험을 향상시키고 트래픽을 분석하기 위해 쿠키를 사용합니다. See our privacy policy.