BTC $86,083.60 +1.48%
ETH $2,715.35 +0.79%
BNB $792.97 +1.04%
XRP $1.51 +1.44%
SOL $120.43 -0.23%
TRX $0.3353 +0.03%
DOGE $0.0958 +3.47%
ADA $0.2690 +10.62%
BCH $319.95 +1.00%
LINK $14.14 +0.87%
HYPE $90.33 +0.56%
AAVE $180.29 -1.13%
SUI $1.23 +4.74%
XLM $0.2247 +4.74%
ZEC $1,330.47 +1.89%
AAPL $333.13 -0.06%
AMZN $251.92 -0.17%
GOOGL $343.81 -0.05%
MSFT $515.41 -0.45%
META $726.47 -0.59%
NVDA $235.44 +0.39%
TSLA $372.04 +0.08%
SNDK $1,729.81 +0.74%
INTC $117.42 +0.17%
SPCX $160.13 +0.82%
MU $1,077.80 +1.04%
AMD $637.14 +0.49%
BTC $86,083.60 +1.48%
ETH $2,715.35 +0.79%
BNB $792.97 +1.04%
XRP $1.51 +1.44%
SOL $120.43 -0.23%
TRX $0.3353 +0.03%
DOGE $0.0958 +3.47%
ADA $0.2690 +10.62%
BCH $319.95 +1.00%
LINK $14.14 +0.87%
HYPE $90.33 +0.56%
AAVE $180.29 -1.13%
SUI $1.23 +4.74%
XLM $0.2247 +4.74%
ZEC $1,330.47 +1.89%
AAPL $333.13 -0.06%
AMZN $251.92 -0.17%
GOOGL $343.81 -0.05%
MSFT $515.41 -0.45%
META $726.47 -0.59%
NVDA $235.44 +0.39%
TSLA $372.04 +0.08%
SNDK $1,729.81 +0.74%
INTC $117.42 +0.17%
SPCX $160.13 +0.82%
MU $1,077.80 +1.04%
AMD $637.14 +0.49%

추론

전체
글
뉴스 플래시

first_img 지프가 GLM-5.3 Flash를 발표했으며, 10만 장의 국산 칩이 추론 서비스를 제공하고 DeepSeek V4 Flash와 경쟁합니다

지표가 발표한 경량급 플래그십 모델 GLM-5.3 Flash는 DeepSeek V4 Flash에 대응하기 위해 설계되었으며, 10만 장 이상의 국산 칩 클러스터를 호출하여 추론 서비스를 제공합니다. 이 모델의 파라미터 규모는 약 300B로 GLM-5.3의 40%에 해당하며, DeepSeek V4 Flash와 기본적으로 비슷합니다. MoE 아키텍처를 채택하여 실제 활성화된 파라미터는 약 18B이며, 원래의 멀티모달 능력을 갖추고 있어 이미지와 비디오 입력을 지원합니다. 또한, 지표가 코딩 전략에 집중한 후 첫 번째로 멀티모달 능력을 갖춘 새로운 모델입니다.종합 평가 점수는 이전 세대 플래그십 GLM-5.2를 초과하며, Claude Opus 4.8과 동일하고 DeepSeek V4 Pro 정식 버전 관련 점수보다 높습니다. 가격은 백만 토큰 입력 0.8 위안, 출력 2.8 위안, 캐시 적중 0.23 위안으로 GLM-5.3의 약 10분의 1이며, 출시 전 두 주 동안 반값 할인 혜택을 제공합니다. 모델은 전면적으로 국산 컴퓨팅 파워에 적합하며, 온라인 트래픽은 국산 칩이 수용합니다. 지표는 클러스터 하드웨어 효율성과 단위 토큰 비용이 주류 엔비디아 GPU 수준에 도달했다고 주장합니다. 이 모델은 이전에 코드명 Ox Alpha로 해외 플랫폼에서 익명 테스트를 진행한 바 있습니다.

hot_img Cerebras는 네 번째 세대 AI 추론 시스템 CS-4를 발표했습니다: 성능이 두 배, 전력 소비가 두 배, 배포가 더 유연해졌습니다

Cerebras는 이번 주에 네 번째 세대 AI 추론 시스템 CS-4를 발표했습니다. 동일한 5nm WSE-3 웨이퍼를 기반으로 하여 클럭 주파수와 전력 소비를 두 배로 늘려 성능을 두 배로 향상시켰습니다. 단일 CS-4 캐비넷은 3개의 웨이퍼를 수용할 수 있으며(CS-3는 2개), 모듈화된 "백팩" 디자인으로 제조 및 배포를 간소화하였고, TDP는 약 125에서 135kW입니다. CS-4는 사용자당 초당 거의 4000 토큰의 추론 속도를 제공하며, 이는 CS-3의 약 두 배에 해당하며, AMD, AWS Trainium 등 이종 시스템과의 분해 추론을 지원합니다.Cerebras는 CS-4가 엔비디아 Rubin의 칩 내 메모리 대역폭의 약 2000배(43PB/s)를 제공한다고 주장하지만, 44GB SRAM 용량은 변하지 않았으며, 긴 컨텍스트 추론에는 여전히 다중 웨이퍼 스택이 필요합니다. DeepSeek V4 Pro(1.6T 파라미터)를 예로 들면, 1M 컨텍스트 윈도우에서 약 20세트의 시스템이 필요하고, 256 동시 처리에서는 약 40세트의 시스템이 필요하며, 이에 따른 CAPEX는 2000만 달러를 초과합니다. Cerebras는 OpenAI 등 고객과 협력하고 있으며, 매년 약 2배의 성능 향상을 목표로 하고 있으며, 2027년까지 20배의 처리량 증가를 목표로 하고 있습니다. CS-4의 "백팩" 캐비넷 디자인은 다음 세대 "Nexus" 플랫폼으로 이어질 것입니다.

hot_img Canva는 AI 추론 비용이 너무 높아 기능 출시를 늦추고, 수익 성장 예상치를 20%로 하향 조정했습니다

디자인 소프트웨어 회사 Canva는 AI 기능의 제공 비용이 예상보다 훨씬 높아짐에 따라 연간 수익 성장 예상치를 20%로 3분의 1 낮췄습니다. CEO 멜라니 퍼킨스는 사용자들이 AI 기능에 대한 수요가 "예상보다 상당히 초과했다"고 밝혔지만, 회사는 구조 최적화, 단위 비용 절감 및 비즈니스 모델 개선을 완료하기 전까지 대규모 관련 제품 출시를 연기하기로 결정했습니다. 4월에 Canva AI 2.0을 출시한 이후, 단일 작업 비용은 거의 90% 감소했지만, AI 사용자가 생성한 디자인 양은 이전 버전의 3배에 달하며, 경제성은 여전히 압박을 받고 있습니다.이 사례는 소프트웨어 산업의 일반적인 곤경을 반영합니다: AI 추론 비용이 전통적인 소프트웨어 "제로 마진 비용"의 수익 논리를 깨뜨리고 있습니다. Pitchbook 분석가는 Canva와 Figma가 이 추세의 "가장 뚜렷한 신호"라고 지적했습니다. Figma의 2분기 자유 현금 흐름 이익률은 1분기의 27%에서 14%로 감소했으며, 3분기 수익 성장률은 48%에서 36%로 둔화될 것으로 예상됩니다. Canva는 이전에 420억 달러의 가치로 직원 주식을 매각했으며, 시장은 2026년 상장을 예상했지만, 현재 분석가들은 IPO가 내년으로 연기될 가능성이 있다고 보고 있습니다.

hot_img SemiAnalysis: SpaceX는 2027년까지 10GW 데이터 센터를 건설할 것으로 예상되며, 추론 수익은 3000억 달러에 이를 것으로 보입니다

연구 기관 SemiAnalysis가 발표한 분석에 따르면, SpaceX는 2027년 말까지 약 10GW AI 데이터 센터 용량을 구축할 것으로 예상되며, 이 중 50%가 추론 서비스에 사용될 경우, GW당 연간 수익이 1000억 달러를 초과한다고 가정할 때, 연간 수익은 3000억 달러에 이를 수 있습니다. SpaceX CEO인 일론 머스크는 첫 번째 재무 보고서에서 "보수적으로 추정하면" 2027년에 6-8GW가 추가될 것이며, 실제로는 10GW를 초과할 수 있다고 밝혔습니다.SemiAnalysis의 추론 시뮬레이터는 GB300 클러스터에서 현재의 신생 클라우드 가격(약 3달러/GPU 시간)으로 운영할 경우, OpenAI와 Anthropic과 같은 최전선 모델 회사들이 GW당 연간 수익이 1000억 달러를 초과할 수 있으며, 연간 비용은 약 120억 달러에 이를 것이라고 보여줍니다. 마이크로소프트는 OpenAI 모델에 대한 완전한 접근 권한을 바탕으로 훈련 비용을 부담하지 않고도 동일한 규모의 수익을 확보할 수 있습니다. 분석에 따르면, 마이크로소프트는 2026년까지 10GW 데이터 센터 계약(총 가치 3000억 달러 초과)을 체결했으며, 90일 취소 조항이 있어 계약 위험을 크게 줄였습니다.SpaceX의 건설 진행 상황에 대해 SemiAnalysis는 머스크가 현장 가스 발전, 대형 전력 변압기를 건너뛰는 등의 병목 현상을 해결하고, 병행 시공 및 조정 프로세스를 단축함으로써 건설 주기를 대폭 단축할 것이라고 보고 있습니다. 테네시주 사우스헤이븐 발전소는 2월의 27대 터빈(약 495MW)에서 7월의 69대(1.7GW)로 확장되었으며, "MiniHard" 프로젝트는 약 5개월 만에 450-500MW를 건설할 수 있습니다. 그러나 10GW 목표는 여전히 토지 승인, 가스 공급 및 장비 납품 등 여러 가지 도전에 직면해 있습니다. 이 분석은 모델 추론을 기반으로 하며, 실제 실행에는 여전히 불확실성이 존재합니다.

Marvell은 AI "메모리 디커플링" 아키텍처를 출시하여 에이전틱 AI 추론의 대역폭 병목 현상을 해결할 것입니다

공식 소식에 따르면, Marvell Technology는 AI 인프라를 위한 차세대 메모리 솔루션 조합을 발표하였으며, 서버급 AI 스토리지, 랙급 CXL 메모리 확장 및 풀링, 다중 캐비닛 광 상호 연결 공유 메모리를 포함하여 Agentic AI 추론 과정에서 증가하는 메모리 용량과 대역폭 병목 현상을 해결하는 것을 목표로 하고 있습니다.Marvell은 AI 모델의 규모가 확대되고, 컨텍스트 윈도우가 연장되며, KV Cache 수요가 증가함에 따라 전통적인 컴퓨팅과 메모리의 긴밀한 결합 아키텍처가 AI 추론 효율성을 제한하고 있다고 밝혔습니다. 메모리 분리(memory disaggregation)를 통해 메모리 자원을 컴퓨팅 자원과 더 독립적으로 확장할 수 있어 GPU 활용도를 높이고 데이터 이동 지연을 줄일 수 있습니다. 이번에 발표된 제품은 다음과 같습니다:Bravera SC6 PCIe 6.0 SSD 컨트롤러: AI 추론 스토리지 시나리오를 위해 설계되었으며, 클라우드 서비스 제공업체가 더 많은 KV Cache를 고성능 SSD로 이전하여 인프라 효율성을 높이는 데 도움을 줍니다. 이 제품은 다수 공급업체 NAND와 호환되는 아키텍처를 채택하고 있으며, 2026년 4분기부터 샘플이 제공될 예정입니다.Marvell Structera X 메모리 확장 솔루션: CXL 기술을 기반으로 하여 랙급 메모리 확장 및 자원 풀링을 지원하며, 데이터 센터가 메모리 자원을 보다 유연하게 공유하고 조정할 수 있도록 도와 AI 인프라 비용을 절감합니다.Marvell Photonic Fabric 광 상호 연결 메모리 솔루션: 광 상호 연결 기술을 통해 다중 캐비닛 공유 메모리 아키텍처를 구축하며, 최대 32TB의 온도 KV Cache 언로드를 지원하고 AI 추론 클러스터의 처리 능력을 향상시킵니다.Marvell은 Photonic Fabric 솔루션이 기존 데이터 센터의 공간 및 전력 소비 제한 내에서 최대 2배에서 3배의 Token 처리량 향상을 달성할 수 있으며, 더 큰 규모의 모델과 더 긴 컨텍스트 AI 애플리케이션을 지원한다고 밝혔습니다.Marvell의 고위 경영진 Will Chu는 AI 인프라가 단일 서버 아키텍처에서 컴퓨팅, 메모리 및 연결이 협력하여 운영되는 시스템으로 전환되고 있으며, 미래의 메모리는 자원 활용도와 Token 효율성을 높이기 위해 더욱 독립적으로 확장되어야 한다고 말했습니다.AI Agent와 대규모 모델 추론 수요가 지속적으로 증가함에 따라, 메모리 용량, 대역폭 및 데이터 전송 효율성이 계산 능력 다음으로 AI 인프라 경쟁의 새로운 초점이 되고 있습니다.
2026-08-04

로이터 통신: 소식에 따르면 DeepSeek가 자체 AI 추론 칩을 개발하고 있다고 합니다

보도에 따르면, 세 명의 관계자가 중국 AI 스타트업 DeepSeek가 자체 AI 칩을 개발하고 있다고 전했습니다. 이 칩은 주로 AI 계산의 추론 단계에 맞춰 설계되었으며, 새로운 모델 훈련에는 사용되지 않습니다. 이 조치는 회사가 엔비디아와 화웨이 칩에 대한 의존도를 줄이기 위한 것입니다.보도에 따르면, 이 칩 개발 계획은 약 1년 전 시작되었으며 현재는 초기 단계에 있습니다. DeepSeek는 칩 설계, 위탁 생산업체 및 저장소 회사 등 외부 파트너와 논의 중이며, 최근 몇 달 동안 비공식 경로를 통해 칩 설계 엔지니어 채용을 강화했습니다. 또한, 소식이 전해진 후 엔비디아의 주가는 장전 거래에서 약 1.6% 소폭 하락했습니다.분석가들은 개발이 성공할 경우, 이는 DeepSeek의 중대한 전략적 전환을 의미할 것이며, 글로벌 주요 AI 개발자들이 하드웨어 자율성을 추구하는 추세에 부합할 뿐만 아니라 화웨이가 국내 AI 칩 시장에서의 지위에 도전할 가능성이 있다고 보고 있습니다. 그러나 이 프로젝트는 여전히 긴 설계 주기, 대규모 자금 요구, 미국의 첨단 공정 및 고대역폭 메모리(HBM) 수출 제한 등 제조 장벽에 직면해 있습니다. 이 칩 개발 움직임은 최근 DeepSeek가 70억 달러의 첫 번째 자금을 모금할 계획에 대한 보도와도 일치합니다.
app_icon
ChainCatcher Building the Web3 world with innovations.