当你想用AI做一道正宗的意大利Carbonara,ChatGPT却告诉你需要“半杯牛奶”——这荒唐的用量,正是许多人在厨房里遭遇的“AI幻觉”。如今,一款名为CookWing的AI应用试图终结这种尴尬:它通过构建原产地锚定数据表,将食材用量的准确率提升至90%,并在开发者自建的基准测试中给出了令人信服的结果。
当AI厨师遭遇“幻觉”困境
自大语言模型(LLM)普及以来,AI“厨师”已成为热门应用场景。用户只需输入菜名或食材,AI就能生成完整的菜谱,包括步骤和用量。然而,一个致命缺陷始终存在:模型常常“胡编”关键数据——比如一道菜需要多少盐、多少面粉。这种“用量幻觉”不是简单的偏差,而是脱离现实的无意义数字,直接导致烹饪失败。开发者“redwing”在Hacker News上坦言,这正是他开发CookWing的初衷:“我在用ChatGPT做菜时,最大的问题是经常被给出完全错误的用量。”
自建基准测试,量化用量准确率
为了验证AI在烹饪中的实际表现,开发者没有依赖现有评测集,而是亲手构建了一套名为“CookBench v1”的烹饪用量基准测试。该测试覆盖了多道经典菜式,并明确了每道菜品的“正确用量”标准——这些标准并非来自英文网络,而是基于菜谱的原产地国家资料。例如,制作意大利Carbonara时,基准数据来自意大利语网站,而非英语版本。这种“归源”方法确保了用量的地道性和准确性。
在测试中,CookWing系统在平均多次运行中达到了90%的“正确运行”率——即输出的所有食材用量均在合理范围内。开发者强调:“我亲自烹饪了这些菜,清楚知道每道菜所需的精确用量,所以90%这个数字是真实的。”
锚定原产地数据,从根源解决幻觉
CookWing的核心技术并非依赖模型的“常识”,而是引入了一套“锚定表格”系统。系统会针对每道菜,首先搜索其原产地国家的权威数据源(如意大利的食谱网站、中国的传统菜谱库等),提取出标准的用量“锚点”。当用户提问时,AI会基于这些锚点进行推理,而非凭空生成数字。这种做法本质上将“自由生成”转化为“检索+推理”,从而大幅降低了幻觉率。
从“AI胡编”到“精准厨师”:实测结果令人惊喜
在Hacker News的帖子中,开发者展示了基准测试结果图(链接见原文)。数据显示,在多个菜式类别上,CookWing的用量准确率显著高于通用LLM。例如,在意大利面类、汤品类等测试中,错误率仅为个位数。开发者还提到,自己逐一烹饪了这些菜来验证,确保基准数据本身无误。这种“自测+自用”的闭环,让可信度进一步提升。
行业意义:AI如何攻克“数字幻觉”?
CookWing的案例揭示了AI在特定领域应用中的一个关键方向:当任务涉及精确数字(如食材用量、药物剂量、化学配比)时,单纯依赖模型参数化记忆是不可靠的。更好的路径是“数据锚定”——将模型与经过验证的、领域特定的数据库结合,让模型扮演“检索+推理”的角色,而非“创造者”。这种做法不仅适用于烹饪,也可能推广到其他需要精确度量的场景,如实验室配方、工业制造参数等。
此外,CookWing的“归源”策略(即使用原产地数据)也值得关注:不同文化背景的菜谱存在显著差异,同一道菜的中文版和英文版可能用量完全不同。AI系统若只学习英文网络,会天然偏向西式标准,而忽略本地化细节。因此,让AI学会“寻找源头”而非“通用答案”,是提升准确性的关键一步。
尽管CookWing目前仅是一款小团队开发的Android应用,尚未大规模推广,但它为AI在实用领域的落地提供了有价值的思路:与其追求一个无所不能的“万能模型”,不如为特定任务打造一个“有根有据”的专家系统。当AI不再胡编乱造,它才能真正成为厨房里的得力助手。