用户用 4×RTX PRO 6000 WS 跑 GLM 5.3 Flash Q4(约190–200GB),43 轮生成 811 个对象、36K 输出 token,10 秒开始摆放且 9×8m 双层挑空符合规格;全量 GLM 5.3(450–470GB Q4)在 6×卡上花 21m55s/82K token 才放置,仅匹配到 9×4.5m。
infinitum 资讯聚合
Google Research 发布 330M 参数的 TimesFM-3 开源多变量时序预测基础模型,并在 Hugging Face 同步上线,被列入本期高互动推文。
dair_ai 与 omarsar0 介绍 WikiSkill / SKILL.state,将持续对话历史替换为显式可变状态与持久技能知识,宣称在长程任务上提升准确率并降低累计 token 用量。
omarsar0 介绍腾讯 ContextPilot,训练代理编辑自身工作上下文,并对具体上下文编辑分配奖励,以更细粒度的 RL 信用分配应对长程任务,被视为上下文管理新前沿。
Meta 将编码代理 Muse Code 推向正式可用,附带可嵌入自定义代理、连接工具、流式进度与恢复会话的开发者 SDK,Ollama 已支持其 harness,订阅与 SDK 详情由 finkd、alexandr_wang 等公开。
SlopTV 用 LLM 将 YouTube 实时聊天扩展为约400词结构化提示,由 MiniMax H3 在 2×RTX 5090 上渲染15秒片段,每 GPU 约90秒出一片、双卡约45秒一片;H3 总磁盘约66GB(19.5GB int8 剪枝扩散+14.6GB NVFP4 文本编码器),用 ComfyUI VRAM offload 与 gRPC 直播聊天 API 规避 REST 配额。
StasBekman 介绍 Snowflake 将模型权重常驻固定 CPU 内存、按需回填 GPU 的 Semi-Persistence 方案,官方基准显示其休眠/唤醒周期较对比 vLLM 基线快5.6至19.9倍。
宣传页显示 Framework Desktop 提供 192GB LPDDR5X、AMD Ryzen AI Max+ PRO 495、273GB/s 带宽、131 TOPS AI 算力;社区担忧带宽仅与 RTX 3050 接近,更适合装入更大模型而非追求高吞吐推理。
runwayml 与 c_valenzuelab 描述 Solaris 实时逐帧生成可交互界面、无需代码,结构相似度与信息保留优于前沿 LLM;定位图像即界面、整帧被模拟,作为代理动态训练环境。
Virtualizor VPS管理面板遭受严重供应链攻击。攻击者于2026年8月28日至30日通过劫持Softaculous部分服务器IP的BGP路由,将面板更新流量导向恶意主机,持续33小时。BGP劫持还影响Let's Encrypt验证请求,攻击者可获取Virtualizor相关域名的有效证书。由于Virtualizor缺乏更新签名验证,下游数百家VPS提供商的宿主机被植入后门,恶意代码以root权限执行,添加攻击者SSH密钥并下载Java持久化程序连接31.77.220.138:2025。AlbaHost确认5台宿主机感染,DreamIT Host最先在LowEndTalk发出警告。建议所有使用Virtualizor面板的VPS用户立即备份数据,防范勒索软件部署和数据窃取风险。