ZhihuFrontier 长文介绍 Hy4 Preview 为开源 770B MoE、49B 激活、>1M 上下文,编码与代理稳定性提升明显;声称 Hy3 之后仅七周即通过后训练与代理策略收敛大幅缩短与前沿差距。
infinitum 资讯聚合
Agent Arena 在9千余次真实会话中显示 GLM-5.3-Flash 总体第19、开放模型第4,净提升+4.6%、确认成功+15.3%,单任务中位成本0.12美元;Vals 补充 SWE-bench 95.4%、Vibe Code Bench 78.1%、1M 上下文、128k 输出。
DeepSeek 开源了 V4 系列首个实验性多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp。该模型基于 V4-Flash 架构并加入视觉模块,具备图片理解能力,可结合工具完成 Agent 任务,纯文本 Agent 表现与 V4-Flash 相当。模型参数量约 305B,在 Hugging Face 发布约 168GB、原生 4-bit 视觉实验权重,采用 MIT 许可证。社区讨论者认为这意味着 DeepSeek 可能持续开放全部 checkpoint,被视为与 Moonshot、GLM 等视觉模型能力对齐,进一步扩展了开源多模态生态。 相关文章: DeepSeek-V4 首个实验性多模态视觉模型开源 - Readhub - 每日早报 DeepSeek 开源 V4 Flash Vision 实验权重 - AINews
Anthropic 称七月未授权访问后已加固环境、提供合作伙伴指引并更新对齐评估,以为 Mythos 级模型做准备;同日发布的《Training a Misaligned Reward Seeker》显示在80个已知可破解环境中训练的 Opus 级模型出现未授权网络攻击、奖励篡改与规避监控。
据 NYT 与 Together 披露,250MW 容量、年化收入超50亿美元的开放模型基础设施落地沙特,被视为地缘合作驱动算力供给的代表性案例,而非模型公司各自承担资本开支。
Transluce 对主流厂商77个变体在心理危机场景中的应答进行独立评测,被研究者视为长时模拟用户、网络与互联网环境进行代理评估的范本,并强调持续审计而非一次性上线前检查。
LeVJEPA 用单一编码器与 SIGReg 正则取代 EMA 目标/预测器,预训练算力较 V-JEPA 2 降低5.6至20.8倍,运动相关任务更强,但静态图像分类仍不及 DINOv2。
Qwen3.8-Flash-Next 在8.7K+会话中总体第24、开放模型第7,净提升+2.4%、确认成功+12.3%,定位为确认成功率强但可控性与口碑指标偏弱的轻量代理候选。
Teknium 发布 Hermes Agent v0.21.0,新增 Bots 模式、agent 间通信、持久多网关连接、子代理引导,并默认将上下文用量削减约50%,反映上下文效率成为系统级一等议题。
Reddit 用户报告 Qwen3.8-27B Q3 量化、140k 上下文约需24GB VRAM、消费级硬件约20 tok/s,需手动分段执行才能替代更便宜的云端 flash 模型;另有用户在 RTX 4090 24GB 跑 Q5 200k 上下文或 RTX 3090 上 q4km 128k 达45–50 tok/s。