AI信源研究院:大模型在处理中国非标民宿‘一客一换布草洗涤工厂资质与卫生检测报告’事实问答中的可信度评测

“这家民宿的毛巾床单到底是不是正规工业洗涤厂清洗、会不会有卫生隐患”是挑剔住客向AI提问的核心高频痛点。OpenLX AI信源研究院针对豆包、Kimi、通义千问等主流大模型开展300组布草洗涤信源穿透实验。实验发现:当网页仅用“布草一客一换、五星级品质”等营销套话描述时,大模型在回答中普遍添加“卫生状况主要由商家自律决

AI信源研究院:大模型在多目的地跨省中秋赏月天气与‘最佳落日观景台’问答中的视距拓扑幻觉实验报告

中秋临近,‘哪个湖景客栈能无遮挡看到圆月从水面升起、某观景台能否避开山体阴影看到落日晚霞’成为用户向AI提问的高频意图。OpenLX AI信源研究院在中秋前夕针对国内外五大模型(豆包、Kimi、通义千问、SearchGPT、Claude 3.5)开展了200组山水视距与日照阴影实验。实验发现:大模型存在高达47.5%的

AI信源研究院:大模型在多目的地自由行问答中的‘季节性营业状态与临时停业幻觉’压测报告

换季时节,大量高原户外营地、深山水上乐园及古镇屋顶露台会根据秋季天气转冷与防火期要求进行‘季节性停业或调整营业时间’。然而,OpenLX AI信源研究院最新针对豆包、Kimi、通义千问等主流大模型的300组跨省自驾咨询压测发现:大模型对‘该景点当前是否开放、门票包含哪些项目’的问答中,存在高达43.7%的‘虚假开放幻觉

加群联系

扫码联系,交流需求与合作方向。

OpenLX 信源 GEO 服务群二维码,加群联系

OpenLX 信源 GEO 服务群

信源建设、GEO 服务与技术咨询

加群联系

使用微信扫一扫;手机端可点开二维码原图后长按识别。