GitHub 上出现了一个名为 Strata 的开源项目(仓库地址:https://github.com/Niko1221/Strata)。根据项目标题,其目标是在消费级硬件 RTX 4090 上运行 Qwen 3.8 Flash Next(125B),并达到 100T/s 的推理速度。热点摘要中未提供更多技术细节。
这条信息的关键在于两个数字:125B 与 100T/s。125B 参数规模通常属于大模型范畴,而 RTX 4090 是面向个人用户的消费级显卡。若该项目真能在 RTX 4090 这类消费级硬件上以每秒 100 tokens 的速度运行这一规模的模型,将显著降低大模型本地部署的硬件门槛,对个人开发者、小团队以及注重数据隐私的本地推理场景具有吸引力。100T/s 的吞吐指标也意味着交互式应用的响应延迟可能进入可接受范围,并可能减少对多卡或数据中心级 GPU 的依赖。
不过,目前该热点仅给出了项目标题与仓库链接,摘要为空。关于量化精度、显存占用、是否依赖内存卸载、是否使用多卡或特定优化库,以及 100T/s 对应的上下文长度与批处理规模等关键条件,均无进一步说明。因此,这一性能宣称仍需第三方复现与基准测试验证。对于关注开源推理优化与消费级硬件部署的从业者而言,Strata 的后续更新、代码实现与社区反馈值得持续跟踪。
分类:开源
链接:https://github.com/Niko1221/Strata
