经营回放
看一次模拟里每天发生了什么:顾客在店里怎么走、街坊去了哪家店、钱是怎么赚的。
财务报表
复式记账自动生成,每月末结账。经济利润=会计利润 − 店主劳动按时薪折算 − 投入资本的机会成本。
实验对比
同一场景只改一个条件,各组用相同的随机种子重复多次,按种子配对比较。
亲自经营
你来当店长。每天收档后做决定,和同一场景下的规则版店长比成绩。
店长训练
看模型店长怎么从一个什么都不懂的新手,一代代练成会经营的店长。
店长的大脑是一个小神经网络。每周日晚上它读一份经营快照(上周销售、客流、毛利、份额、断货、报废、现金、明天天气、正在发生的突发事件),定下这一周的 6 个策略:冲动品(零食饮料等)和必需品(粮油日用等)各自贵几成或便宜几成、临期打几折、备货多还是少、几点开门、几点关门。每天订几箱由补货规则按这些策略执行——老板定策略,伙计照做。
分数是一年的经济利润:会计利润再扣掉店主每小时 25 元的劳动和投入资本的机会成本。破产重罚 10 万元。
像选秀:每一代把当前的店长复制出 16 个性格略有不同的版本,各自在 2 个随机年份(含随机突发事件)里经营一整年,年底比谁赚得多;赚得多的往哪个方向偏,下一代就整体往那个方向挪一点。重复几十代。
和常听说的 PPO 的区别:PPO 像有师傅逐周点评,每周的决定当场归功、当场微调,学得细但要猜"哪周的决定起了作用";小卖部的回报很滞后(降价后客人几周才回流),所以这里用只看全年总账的进化策略,更稳、不用额外的库、能多进程并行。
参数影响
每个参数是一个研究变量:看它从低到高变化时,经营结果怎么变;以及它的数据来源靠不靠得住。
还没有运行。命令:python3 tools/sensitivity.py