StepFun이 600B MoE를 API로 열었고, 가중치는 10월 15일로 남겨뒀습니다
StepFun이 2026년 9월 20일 Step 5 Preview를 발표하고 같은 날 자사 제품과 API에서 호출할 수 있게 했습니다. StepFun 문서에 따르면 토큰당 27B를 활성화하는 600B 희소 MoE이고, 컨텍스트는 1M 토큰에 텍스트·이미지·영상 입력을 받습니다. 출력 상한은 사양표에 64k 토큰으로 적혀 있는데, 같은 페이지의 Chat Completions 항목은 max_tokens 기본값에 상한을 두지 않는다고 설명합니다. 긴 출력을 전제로 설계한다면 실제 한도를 먼저 실측하십시오. 가격은 백만 토큰당 입력 $1.00, 캐시 적중 $0.05, 출력 $2.70입니다(StepFun 가격표). 직전 플래그십인 Step 3.7 Flash의 $0.20과 $1.15에 견주면 입력은 5배, 출력은 2.3배입니다. 독립 평가에서 Artificial Analysis는 지능 지수 44점과 작업당 비용 $0.71을 기록했고 출력 속도는 초당 99.8토큰입니다. 가중치는 아직 나오지 않았습니다. StepFun은 전체 가중치를 10월 15일에 공개하겠다고 밝혔습니다. 발표 당일 Hugging Face 저장소에는 .gitattributes 파일 하나만 있었습니다(OrcaRouter 확인). 회사가 내건 Opus 5 대비 8분의 1 비용과 자체 벤치마크 점수는 계산 방법을 밝히지 않았으니, 그 숫자를 인용할 때는 출처를 함께 적으십시오. 평가 보드는 이 모델을 9월 18일자로 적어 뒀습니다. 발표 이틀 전부터 호출은 가능했고 이름과 가격표는 나중에 붙었습니다. 10월 15일 이전까지는 오픈웨이트 계획을 확정 사실로 쓰지 마십시오.
오늘 정할 수 있는 것은 어떤 요청을 어디로 보낼지이고, 그 기준은 작업당 비용입니다
가중치가 도착하기 전까지 Step 5 Preview는 한 회사가 값을 정하는 빌린 모델입니다. 지금 바꿀 수 있는 결정은 어떤 요청을 이 모델로 보낼지입니다. 그 판단에 쓸 숫자는 백만 토큰 단가가 아니라 작업 하나를 끝내는 비용이니, 모델을 고를 때는 내 작업 로그를 먼저 보십시오. Artificial Analysis가 잰 $0.71에는 이 모델이 말이 길다는 사실이 반영돼 있습니다. 지능 지수 한 번을 도는 동안 출력 토큰이 1억 6천만 개로, 같은 지표의 중위값인 9천 2백만 개보다 70% 이상 많습니다. 출력 단가가 $2.70인 모델에서는 이 수다스러움이 단가표가 주는 인상보다 청구서를 빠르게 밀어 올립니다. 캐시 적중 가격 $0.05는 조건부입니다. 같은 접두사를 다시 보내야 적용되므로, 매 턴 1M 컨텍스트를 새로 조립하는 에이전트 루프는 입력 단가 $1.00을 그대로 냅니다. 안정된 긴 컨텍스트를 재사용하는 구조라면 입력 비용이 20분의 1로 떨어집니다. 내 구조가 어느 쪽인지 확인하려면 같은 요청을 두 번 보내고 캐시 적중 토큰 수를 비교하십시오. 지금 해볼 만한 확인은 세 가지입니다.
- 내 워크로드에서 작업 하나에 실제로 몇 토큰이 나오는지 재보십시오. 그 값에 단가를 곱한 결과가 비교 기준입니다.
- 프롬프트에서 변하는 부분이 안정된 컨텍스트보다 앞에 오는지 확인하십시오. 순서를 바꾸는 것만으로 입력 단가가 $1.00과 $0.05 사이에서 움직입니다.
- 모델 이름과 가격은 코드가 아니라 설정에 두십시오. 10월 15일에 가중치가 실제로 나오면 같은 파이프라인에서 엔드포인트만 바꿔 쓸 수 있습니다.
오늘의 다른 소식 (한 줄)
- 알리바바 Qwen-Image-2.1 가중치 공개: 시각 생성부가 7B인 이미지 생성·편집 모델로, 투명 이미지(RGBA)를 직접 만들고 참조 이미지를 최대 10장 받습니다. 라이선스가 qwen-research여서 상업적 사용에는 별도 허가가 필요합니다. Hugging Face
- 텐센트가 Gander를 공개했습니다: 말하는 동안 백그라운드에서 파일 검색과 코딩 작업을 이어가는 구조로, 대화를 유지하는 소뇌와 교체 가능한 뇌를 나눴습니다. 벤치마크에서 사용자 방해는 8%로 가장 적었지만 작업 정확도는 뒤졌습니다. The Decoder
- 월드 모델 회사들이 제품 계획을 밝히지 않는다는 취재가 나왔습니다: AMI Labs와 World Labs가 모두 연구 단계라고 답했고, 상용화 시점은 확인되지 않았습니다. TechCrunch
- AI 속도 조절 논쟁을 다룬 팟캐스트가 올라왔습니다: 앤스로픽의 프런티어 속도 조절 제안과 젠슨 황의 규제 불필요 주장이 같은 주에 나왔습니다. TechCrunch