经营回放

看一次模拟里每天发生了什么:顾客在店里怎么走、街坊去了哪家店、钱是怎么赚的。

第 1 天 07:00
第 1 天 第 365 天
店内俯视图
街区地图 每个点是一位居民,颜色=最近一次去的店
每日销售额 竖线=店长决策,点图跳到那一天
现金余额与借款
当天各小时销售额
当天品类销售额
市场份额 去小店的出行中选本店的比例
店里刚发生的事

财务报表

复式记账自动生成,每月末结账。经济利润=会计利润 − 店主劳动按时薪折算 − 投入资本的机会成本。

每月净利润与经济利润
利润表
资产负债表 月末
现金流量表 直接法

实验对比

同一场景只改一个条件,各组用相同的随机种子重复多次,按种子配对比较。

各组结果 均值 ± 标准差
和对照组比 配对差值、95% 置信区间(bootstrap)、配对 t 检验
每次运行的结果分布 每个点是一个种子,横线是中位数

亲自经营

你来当店长。每天收档后做决定,和同一场景下的规则版店长比成绩。

店长训练

看模型店长怎么从一个什么都不懂的新手,一代代练成会经营的店长。

它在学什么

店长的大脑是一个小神经网络。每周日晚上它读一份经营快照(上周销售、客流、毛利、份额、断货、报废、现金、明天天气、正在发生的突发事件),定下这一周的 6 个策略:冲动品(零食饮料等)和必需品(粮油日用等)各自贵几成或便宜几成、临期打几折、备货多还是少、几点开门、几点关门。每天订几箱由补货规则按这些策略执行——老板定策略,伙计照做。

分数是一年的经济利润:会计利润再扣掉店主每小时 25 元的劳动和投入资本的机会成本。破产重罚 10 万元。

它怎么学:进化策略

像选秀:每一代把当前的店长复制出 16 个性格略有不同的版本,各自在 2 个随机年份(含随机突发事件)里经营一整年,年底比谁赚得多;赚得多的往哪个方向偏,下一代就整体往那个方向挪一点。重复几十代。

和常听说的 PPO 的区别:PPO 像有师傅逐周点评,每周的决定当场归功、当场微调,学得细但要猜"哪周的决定起了作用";小卖部的回报很滞后(降价后客人几周才回流),所以这里用只看全年总账的进化策略,更稳、不用额外的库、能多进程并行。

成长曲线 灰点:那一代的候选店长;浅蓝:训练分数(每代年份不同,所以忽高忽低);深蓝:用固定年份考出来的验证成绩,可以跨代比较
让不同代的店长经营同一年 默认用验证年份 201(训练没见过);考试年份 101–130 留给最终评估
累计经济利润 按月
每日销售额 7 天平均
冲动品价格倍数 1.0 = 市场参考价
必需品价格倍数
营业时间 实线关门、虚线开门
备货倍数与临期折扣 实线备货、虚线折扣率
这一年发生的突发事件

参数影响

每个参数是一个研究变量:看它从低到高变化时,经营结果怎么变;以及它的数据来源靠不靠得住。

哪些参数最影响净利润 全局敏感性分析(Morris 法):同时扰动全部参数,μ* 越大越重要;颜色是可信度
还没有运行。命令:python3 tools/sensitivity.py
参数
选一个参数