模型实操 实测现场

第一手大模型实测:能力边界、真实成本与翻车现场,看完再决定要不要为它买单。

我用了三周免费的 Space Bunny,现在急着想订阅

Space Bunny(太空兔)是谁家的?没人知道 —— 这正是问题所在。三周真实开发里,它反复推翻自己的结论、认出了我没提名字的实测数据、在我跟别的模型聊天时自己把活干完了。这篇讲的不是跑分,是「敢不敢把整个项目交给它」。附 Space Bunny 改写的费用计算器。

Claude Haiku 5.5 实测:1小时163次请求,花了1.59美元

用 Claude Code 让 Claude Haiku 5.5 改了一小时真实项目:163 次请求、1.5869 美元。16 万 Token 输入为什么一次只花不到 1 美分?缓存命中率才是长上下文账单的关键。

2块钱,让Claude Haiku 5.5做了个超级马里奥

0.342 美元、19 分钟,Claude Haiku 5.5 从零生成了一个能跑能跳、能吃金币能变大的横版马里奥。附 29 秒实机视频与完整账单,便宜档模型现在到底能干活到什么程度?

匿名模型三天登顶,我让它跟DeepSeek和GLM来一轮硬核实测

Space Bunny Alpha 三天冲到 OpenRouter 调用日榜前列,真实身份成谜。本文让它与 DeepSeek V4.1 Flash、GLM 5.3 Flash 在同一套 harness 下做三道 3D/游戏任务,比速度也比完成度。

匿名AI模型三天登顶出圈,真身至今无人知晓

Space Bunny Alpha 匿名上线三天登顶 OpenRouter 调用日榜,供应商栏只写 Stealth。对打 DeepSeek V4.1 Flash 与 GPT-6 Astra:Minecraft 输了,庭园赢了。

GPT-6、DeepSeek V4.1、GPT-5.6实测:同一句话做《我的世界》,谁更强?

把同一句话「写一个我的世界demo,web实现」原封不动发给 GPT-6 Astra、DeepSeek V4.1 Flash、GPT-5.6 Terra,不给任何提示词,看谁一次做完、谁的右键功能做反了。

国内大模型Flash三杰全方位综合对比:GLM-5.3-Flash / DeepSeek-V4-Flash / Qwen3.8-Flash

国内大模型评测与大模型对比:横向全景对比 GLM-5.3-Flash、DeepSeek-V4-Flash、Qwen3.8-Flash 三大国产 Flash 模型的定位、优点、缺点、基准评分与 API 价格,助你选准主力模型。

Qoder 免费账号实测 Qwen3.8-Flash:会下雪的中世纪城堡,0 Credits

用 Qoder 免费账号最高思考档实测 Qwen3.8-Flash:鹈鹕骑自行车与 Three.js 中世纪城堡两题全记录,附 Credits 领取细则。

实测字节新模型Seed 2.1 Pro-0915,比想象中的能打多了!

字节Seed 2.1 Pro-0915实测:通用Agent与Coding能力明显进步,实测表现比想象中能打,附真实体验与豆包Seed2.1系列选型参考。

GPT-6 Astra 做实景三维重建,我拿一套住宅试了试

如视创始人用伽罗华 P4 采集一套住宅的 16 类空间数据(4.3GB),实测 GPT-6 Astra 的实景三维重建能力与边界。

用GPT-6接入Hyper3D,制作游戏和网页,这才是版本答案!

GPT-6 通过 Hyper3D MCP 调用 Rodin 生成 3D 资产,实测 3D 骑行游戏与中国古建筑 3D 拆解网页两个完整案例。

网传能力直逼Astra,实测DeepSeek V4.1 Flash后我崩不住了

网传DeepSeek V4.1 Flash能力直逼GPT-6 Astra?实测打脸还是真香:与Astra、Fable、K3对比全拆解,看它到底几斤几两,附成本与选型建议。

等了一周,我终于用上 GPT-6:让它 20 分钟“盖”了一座南京城(附3个实测项目)

用 GPT-6 实测三个项目:雨夜便利店氛围图、3D 程序化城市生成器(20 分钟生成南京城)与 Agent/Skill 工程优化。

ZPedia|实测DeepSeek V4.1 Flash:CED 架构压低Agent成本,多模态精度仍是短板

DeepSeek V4.1 Flash 开源实测:CED 架构如何压低 Agent 成本,五道评测题暴露了哪些收尾短板。

GPT image 2.5 实测:指哪改哪、草稿成图、AI生图能力又增强了

OpenAI ChatGPT Images 2.5 上线,实测主体一致性、圈选局部修改、手绘草稿成图、扩图与透明背景等新能力,附完整提示词。

ChatGPT Images 2.5 真正值得学的,不是提示词,而是这套新的 AIGC 创作方法

Images 2.5 真正值得关注的不是单张图多漂亮,而是 AI 图片生成从抽卡变成可控创作:先做对一张图,再告诉它哪里能改、哪里不能动。

ChatGPT Images 2.5 的 6 种玩法:提示词直接抄,改图不用再重抽卡

ChatGPT Images 2.5六种实战玩法:局部改图不重抽卡、多图融合等可复制提示词模板一次讲清,从抽卡到可控创作,让你的AI生图效率翻倍。

GPT-image-2.5 发布,生图夯爆了!

GPT-Image-2.5发布当天上手实测:中文信息图、App原型、书店剖视与连续改图,主体一致性大幅增强,生图榜一易主,附完整体验记录与提示词。

GPT-6 Astra · 节省 Token 官方指南

GPT-6 Astra官方节省Token完整指南:会话管理、上下文裁剪与调用参数最佳实践,附官方介绍要点总结,高频使用者省钱必备手册。

DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

DeepSeek V4.1 Flash内测对照实测:14组任务花3亿Token横评,看图与多模态变强,但交付变慢、花费反增36%,能否接班V4 Pro一测见分晓。

1天通关游戏,1周造城:GPT-6 Astra 这7个玩法太上头

盘点GPT-6 Astra七个上头玩法:一天通关《传送门》、一周造出曼哈顿、通过人类验证码考试,直接把电脑交给它会怎样?案例合集一次看完。

GPT-6 Astra 一手实测,熟悉的 OpenAI 回来了!

GPT-6 Astra开放Plus用户实测:一手体验OpenAI最新旗舰模型的编码、推理与多模态能力,真实项目表现与使用建议,熟悉的OpenAI又回来了。

首发深度测评GPT-6 Astra,做游戏效果可以给到夯

GPT-6 Astra推送Plus与Pro后的首发深度测评:5个Plus账号加Pro实测做游戏效果,不看跑分看真实产出,AGI含金量到底有多少一测便知。

这就是AGI?GPT-6 Astra一夜刷屏,真实效果太夸张了

GPT-6 Astra一夜刷屏,AGI感到底来自哪里?汇总6段公开演示与X热议视频,拆解真实效果、亮点与局限,发布初期个人用户如何抢先体验。

腾讯Hy4首发实测,做了个面条下锅游戏,我有点绷不住了

腾讯Hy4预览版首发实测:在WorkBuddy与CodeBuddy免费试用期内,用Hy4做了个面条下锅小游戏,附gamescom灵感来源与模型实际表现点评。

实测Qwen3.8-Flash,比DS V4 Flash 便宜,比Opus4.6强!

Qwen3.8-Flash 实测:每百万 Token 输入 0.8 元,游戏、3D 场景、产品官网一个不落。