1. DemandSupplyFilter -> 出一个grid-wise的filterdptimes(如1.5),在其基础上加上范围,用来给司机看(看到1.2-1.8),调节司机:
1. 供需平衡+pid反馈出一个dp1(这个不太好,希望这个权重低些)
2. ar trigger, 根据dp-ar间关系(此处ar模型预测,参考最新发的DIPN),预测一个期望ar对应的dp2
3. filterdp = max(dp1, dp2)
2. 在估算GMV时的er: GMV = baseprice * DP * er(此处的er=ecr*cr,模型预测)
目前的国际化出行业务分很多:</br> BR -(POP快车 dp8 + odsurge策略, FLEX议价车,MOTO) </br> 现在BR的moto用的策略版本还是dp7,把它升级到dp8(有社招人在做,可能赛马)</br>
尝试RL在策略中的应用,目前两条线
1. 巴西快车在原先的dp8基础上,多了一个ODSurge策略,该策略中 score = GMV + \lambda TCH(eta*er)
即不仅要优化gmv,还要提升总的tch,司机尽可能都在开车,使用rl来调节此处的\lambda
2. 在DemandSupplyFilter中,目前是一两个管线取max出基础dp,修改为rl直出(这个比较直观,但是出的dp只是作为给司机显示的,对后续的优化不显著,可能拿不到收益),目前是校企合作,我跟着听听
三块目标同步推进,时间分配40 40 20
ar模型,cr模型和ecr模型在整体策略中的作用
详细框架见动调串讲文档中的两幅图,我们负责的部分在策略中有两处。